Forschung
60 Briefings
HarnessRisk bewertet Sicherheitsversagen in Agent-Harnesses
Der Benchmark testet Angriffe über verschiedene Phasen von Agent-Harnesses hinweg, während verwandte Arbeiten aufgabenspezifische Bereitstellung untersuchen.
Agent Lightning v1.0 zielt auf agentisches RL mit Harness ab
Das Framework verbindet beliebige Agent-Harnesses mit Post-Training per Reinforcement Learning.
Studie testet modellübergreifende Speicherübertragung für LLMs
Forschende untersuchen, wie sich eingefrorener gelernter Speicher mithilfe eines Readers auf Zielseite zwischen Modell-Backbones übertragen lässt.
DiSCO zielt auf Sicherheit bei Black-Box-Text-zu-Bild-Systemen
Das arXiv-Paper schlägt eine Optimierung auf Prompt-Ebene vor, um NSFW-Ausgaben ohne Zugriff auf das Modell zu reduzieren.
PTXBench testet LLMs bei der Optimierung von GPU-Kernels
Der Benchmark bewertet die architekturspezifische Nutzung von PTX bei GEMM- und Attention-Workloads auf H100- und B200-GPUs.
Forscher schlagen RL-Frameworks für Agenten-Harnesses vor
LEGO-RL und ClawGym II zielen auf stabiles Reinforcement Learning für KI-Agenten mit langen Aufgabenhorizonten.
Forschende stellen SemComp-Bench für Videogenerierung vor
Der Benchmark bewertet, ob generierte Videos die beabsichtigten Ergebnisse erreichen und die Aufgabensemantik bewahren.
Co-RL trainiert Reasoning-Modelle mit Belohnungen aus Peer-Modellen
Das arXiv-Paper schlägt kooperatives Multi-Agenten-RL vor, um die Abhängigkeit von Ground-Truth-Supervision zu verringern.
FACET zielt auf Konsistenz bei der Synthese von Terminal-Aufgaben
Das Framework erstellt und repariert ausführbare Umgebungen für das Training von Terminal-Agenten.
SkillForge trainiert Agents mit repository-spezifischen Skills
Das Framework synthetisiert Projekt-Issues, um wiederverwendbares Wissen für künftige Software-Fixes zu destillieren.
FM-Bench testet Agenten über 20 Jahre Fußballmanagement
Der Benchmark bewertet LLM-Agenten mit langfristigem Horizont anhand Hunderter miteinander verknüpfter Entscheidungen.
Forscher stellen SPADE für Agententraining per Self-Play vor
Das Framework lässt ein LLM ausführbare Umgebungen erzeugen, während eine andere Rolle darin lernt.
SemaPLC testet PLC-Code-Agenten mit Live-Laufzeitprüfungen
Das Testsystem verifiziert generierte PLC-Logik anhand von Spezifikationen, Kompilierung und Verhalten im Einsatz.
Forscher integrieren chemisches Vorwissen in Retrosynthese-KI
Neue Arbeiten zielen auf plausiblere und vielfältigere Reaktionsvorhersagen für die computergestützte Syntheseplanung.
DA-LeWM zielt auf Planungsfehler latenter Weltmodelle
Neue Diagnostiken prüfen, ob latente Distanzen Handlungspläne nach tatsächlichem Aufgabenfortschritt ordnen.
SoftVTBench testet Verformung bei visuo-taktiler Manipulation
Der Datensatz verknüpft Roboterbeobachtungen mit FEM-Ground-Truth für Aufgaben mit verformbaren Objekten.
IBM testet, wie viel Gedächtnis KI-Agenten brauchen
ALTK-Evolve-Studie zeigt: Zugewinne durch Agentengedächtnis hängen von Modellleistung und Auslieferungsstrategie ab.
Forschende stellen TTP-D für die Routenplanung mit Lkw und Drohnen vor
Der neue Benchmark kombiniert Artikelauswahl, lastabhängige Routenführung und Drohnensynchronisierung.
Studie: Audit-Reparatur-Kontext macht LLM-Prüfer nachsichtiger
Das arXiv-Paper berichtet von weniger Fehlalarmen, wenn zuvor Audit-Reparatur-Episoden im Modellkontext standen.
AlphaEvolve senkt Schranke für Matrixmultiplikation
Eine neue arXiv-Notiz meldet eine verbesserte obere Schranke für den Exponenten der Matrixmultiplikation.
Lernen, was noch fehlt, nicht was bereits beherrscht wird: sättigungsbewusste Advantage-Neugewichtung für Policy-Optimierung mit mehreren Rewards
arXiv:2608.
TRACE-Bench nimmt Bildgenerierung mit mehreren Referenzen ins Visier
Der Benchmark zerlegt Prompts in vier Operatoren, um Modellfehler zu diagnostizieren.
Forscher bringen generative Bewegungsmodelle voran
Zwei Arbeiten zielen mit neuronalen Ansätzen auf Bewegungsplanung und Bewegungsverstehen.
Forscher passen OPD für effizienteres Video-Reasoning an
Zwei Arbeiten nutzen Distillation-Techniken, um kleinere oder Streaming-Modelle für Videoverständnis zu verbessern.
Forschende schlagen RUPA für Unsicherheit bei LLM-Agenten vor
Das Framework schätzt die Zuversicht über vollständige Agenten-Trajektorien hinweg, nicht nur für einzelne lokale Schritte.
Neue Arbeiten zielen auf das Training von LLM-Agenten mit langem Planungshorizont
Forschende stellen TRCA, RLCascadeRouter und Agentic ESOpt für Agenten-Credit, Routing und Fine-Tuning vor.
Neue Studien kartieren Serving-Anforderungen für agentische KI
Vier Papers untersuchen Latenz, Caching, Traces und Edge-Serving für agentische LLM-Workloads.
Paper vereinheitlicht Graph Neural Networks in einer einzigen Layer-Gleichung
Das Framework ordnet GNN-Architekturen sieben rechnerischen Komponenten zu.
Forscher nehmen kompositionelle Bild- und Videobearbeitung ins Visier
Neue Paper schlagen Trainingsdaten und Destillationsmethoden für einheitliche Generierungs- und Bearbeitungsmodelle vor.
StartupBench testet Agenten anhand von Startup-Workflows
Der Benchmark bewertet durchgängige Agentenarbeit, abgeleitet aus am Markt validierten KI-Produkten.
Forschende schlagen aDSL für agentische 3D-Erstellung vor
Das Paper kombiniert eine agentenorientierte 3D-Sprache mit einem trainingsfreien Multi-Agenten-Workflow.
Abra-Studie kartiert Skalierungsgesetze für das Training von Diffusionsbildern
HF Daily Papers hebt eine Studie zur Compute-Skalierung von Text-zu-Bild-Diffusionsmodellen hervor.
GS-Voxel zielt auf großskalige 3DGS-Generierung aus der Luft
Das Framework wandelt voroptimierte 3D-Gaussian-Szenen ohne szenenspezifisches Fitting in dünn besetzte, strukturierte Latents um.
Paper schlägt fähigkeitszentriertes Datendesign für Bildgenerierung vor
Das Framework organisiert Trainingsdaten für die Bildgenerierung entlang von Abhängigkeiten zwischen Fähigkeiten.
Forschende stellen ASI-Bench für autonome Wissenschaft vor
Der Benchmark testet innovative Exploration und wissenschaftliche Umsetzung anhand von 60 Forschungsaufgaben.
Studie testet DeepSeek Harness gegen Prompt Injection
Eine Zusammenfassung von HF Daily Papers berichtet über 14.560 kontrollierte Ausführungen in 16 Kanälen für indirekte Inhalte.
Neue Studien nehmen speicherbasierte verkörperte Navigation ins Visier
UniWM und TAMP-Nav schlagen unterschiedliche Wege vor, visuelle Vorhersage, Gedächtnis und Handeln in Navigationsagenten aufeinander abzustimmen.
EditBridge nimmt Bildbearbeitung in ultrahoher Auflösung ins Visier
Die Diffusion-Bridge-Methode soll Quelldetails bewahren, während niedrig aufgelöste Bearbeitungen verfeinert werden.
Forschende nehmen MoE-Latenz bei Vision und Decoding ins Visier
Neue Papers schlagen MoE-Vision-Encoder, schnelleres Small-Batch-Decoding und Online-Lastverteilung vor.
MoE-ViE zielt auf effiziente Skalierung von Vision Encodern
Das Paper untersucht MoE-Designs für CLIP-artige Vision Encoder zur Bild- und Videoanalyse.
InternLM schlägt Mobius-Modellarchitektur vor
Das arXiv-Paper trennt Gedächtnis und Schlussfolgern, um Kompression und Inferenz effizienter zu machen.
R^3-Bench testet LLM-Schlussfolgern unter gemeinsamen Budgets
Der Benchmark bewertet sechs Modelle über Aufgabensuiten hinweg bei begrenzter Rechenzeit.
ClawGym II zielt auf Black-Box-RL für Agent-Harnesses
Das Paper schlägt sandboxed Rollouts und Trajektorien-Rekonstruktion vor, um Agenten durch komplexe Harnesses hindurch zu trainieren.
GenRouter leitet Bildgenerierungs-Prompts an günstigere Workflows weiter
Das Framework standardisiert agentische Bild-Pipelines und routet Prompts passend zu den Anforderungen der Aufgabe.
Ventor-QTest prüft von Anbietern gehostete LLM-APIs
Das Paper schlägt eine Black-Box-Methode vor, um Fidelity-Verluste in gehosteten APIs für Open-Weight-Modelle zu testen.
HarnessEval-W ergänzt agentenbasierte Tests für World Models
Die Benchmark-Pipeline nutzt Subagenten, um Rollouts anhand nachvollziehbarer Begründungsketten zu bewerten.
Studie trainiert schnellere Pixel-Space-Diffusionsmodelle
HF Daily Papers hebt ein Latent-to-Pixel-Rezept für das Training von Text-zu-Bild-Diffusionsmodellen hervor.
AnyTalk erzeugt Sprachanimationen ohne Animationsdaten
Die Methode passt Video-Diffusionsmodelle an, um lippensynchrone 3D-Sprachanimationen für Charaktere zu erstellen.
HiFi-BRep zielt auf robustere B-Rep-Generierung
Das Framework nutzt topologiebewusste Kodierung und paralleles Dekodieren, um CAD-Grenzrepräsentationen zu verbessern.
GRNEdit schlägt leichtgewichtiges instruktionsbasiertes Video-Editing vor
Das Paper beschreibt Video-Edits als Beibehalten-oder-Umschalten-Entscheidungen über binäre visuelle Codes.
Forscher verlagern Diffusionsmodelle in den Pixelraum
Zwei Papers schlagen Diffusionsverfahren im Pixelraum für Bildrestaurierung und Text-zu-Bild-Generierung vor.
KI-Entwicklertools und Arbeitsweisen lösen Debatte auf Hacker News aus
Beiträge zu MathCode, KI-Coding-Gewohnheiten, Cloudflare und Googles HEIR prägten die Diskussion.
Google treibt private KI mit homomorpher Verschlüsselung voran
Google will private KI mithilfe homomorpher Verschlüsselung praxistauglicher machen.
Google will private KI praxistauglich machen
Ein Beitrag im Google Security Blog sorgte auf Hacker News für Diskussionen, flankiert von breiterer Kritik an KI.
Forscher veröffentlichen LittleLearner für kontrollierte LLM-Studien
Das Modell mit 5 Milliarden Parametern wird auf einem Curriculum-Korpus mit 88 Milliarden Tokens trainiert, der Stoff bis einschließlich fünfter Klasse umfasst.
HN diskutiert über KI-Grenzen, Datenschutz und wissenschaftliche Behauptungen
Beiträge zu Wirkstoffforschung, Mathematik, Datenschutz und KI-Laboren sorgten auf Hacker News für rege Diskussionen.
Neue Berichte prüfen KI-Versprechen in Wissenschaft und Arbeitswelt
Diskussionen auf Hacker News rückten Belege zu KI in der Wirkstoffforschung, Mathematik und ChatGPT-Nutzung in den Fokus.
Forscher nehmen Lücken im räumlichen Schlussfolgern von VLMs ins Visier
Neue Arbeiten schlagen Speicher, RL und Benchmarks für räumliche Intelligenz in Vision-Language-Systemen vor.
Google startet Gemini 3.7 Flash für Coding und Agents
Das neue Flash-Modell ist in der Gemini API, in Google AI Studio, Android Studio und Enterprise-Tools verfügbar.