AAI News Hub

Forschung

60 Briefings

Forschung

HarnessRisk bewertet Sicherheitsversagen in Agent-Harnesses

Der Benchmark testet Angriffe über verschiedene Phasen von Agent-Harnesses hinweg, während verwandte Arbeiten aufgabenspezifische Bereitstellung untersuchen.

arXiv cs.AI+1 outlet·1d ago
Forschung

Agent Lightning v1.0 zielt auf agentisches RL mit Harness ab

Das Framework verbindet beliebige Agent-Harnesses mit Post-Training per Reinforcement Learning.

arXiv cs.AI+1 outlet·1d ago
Forschung

Studie testet modellübergreifende Speicherübertragung für LLMs

Forschende untersuchen, wie sich eingefrorener gelernter Speicher mithilfe eines Readers auf Zielseite zwischen Modell-Backbones übertragen lässt.

arXiv cs.AI+1 outlet·1d ago
Forschung

DiSCO zielt auf Sicherheit bei Black-Box-Text-zu-Bild-Systemen

Das arXiv-Paper schlägt eine Optimierung auf Prompt-Ebene vor, um NSFW-Ausgaben ohne Zugriff auf das Modell zu reduzieren.

arXiv cs.AI+1 outlet·1d ago
Forschung

PTXBench testet LLMs bei der Optimierung von GPU-Kernels

Der Benchmark bewertet die architekturspezifische Nutzung von PTX bei GEMM- und Attention-Workloads auf H100- und B200-GPUs.

arXiv cs.AI+1 outlet·1d ago
Forschung

Forscher schlagen RL-Frameworks für Agenten-Harnesses vor

LEGO-RL und ClawGym II zielen auf stabiles Reinforcement Learning für KI-Agenten mit langen Aufgabenhorizonten.

arXiv cs.AI+1 outlet·1d ago
Forschung

Forschende stellen SemComp-Bench für Videogenerierung vor

Der Benchmark bewertet, ob generierte Videos die beabsichtigten Ergebnisse erreichen und die Aufgabensemantik bewahren.

arXiv cs.AI+1 outlet·1d ago
Forschung

Co-RL trainiert Reasoning-Modelle mit Belohnungen aus Peer-Modellen

Das arXiv-Paper schlägt kooperatives Multi-Agenten-RL vor, um die Abhängigkeit von Ground-Truth-Supervision zu verringern.

arXiv cs.AI+1 outlet·1d ago
Forschung

FACET zielt auf Konsistenz bei der Synthese von Terminal-Aufgaben

Das Framework erstellt und repariert ausführbare Umgebungen für das Training von Terminal-Agenten.

HF Daily Papers+1 outlet·1d ago
Forschung

SkillForge trainiert Agents mit repository-spezifischen Skills

Das Framework synthetisiert Projekt-Issues, um wiederverwendbares Wissen für künftige Software-Fixes zu destillieren.

HF Daily Papers+1 outlet·1d ago
Forschung

FM-Bench testet Agenten über 20 Jahre Fußballmanagement

Der Benchmark bewertet LLM-Agenten mit langfristigem Horizont anhand Hunderter miteinander verknüpfter Entscheidungen.

HF Daily Papers+1 outlet·1d ago
Forschung

Forscher stellen SPADE für Agententraining per Self-Play vor

Das Framework lässt ein LLM ausführbare Umgebungen erzeugen, während eine andere Rolle darin lernt.

HF Daily Papers+1 outlet·1d ago
Forschung

SemaPLC testet PLC-Code-Agenten mit Live-Laufzeitprüfungen

Das Testsystem verifiziert generierte PLC-Logik anhand von Spezifikationen, Kompilierung und Verhalten im Einsatz.

HF Daily Papers·1d ago
Forschung

Forscher integrieren chemisches Vorwissen in Retrosynthese-KI

Neue Arbeiten zielen auf plausiblere und vielfältigere Reaktionsvorhersagen für die computergestützte Syntheseplanung.

HF Daily Papers+1 outlet·1d ago
Forschung

DA-LeWM zielt auf Planungsfehler latenter Weltmodelle

Neue Diagnostiken prüfen, ob latente Distanzen Handlungspläne nach tatsächlichem Aufgabenfortschritt ordnen.

HF Daily Papers·1d ago
Forschung

SoftVTBench testet Verformung bei visuo-taktiler Manipulation

Der Datensatz verknüpft Roboterbeobachtungen mit FEM-Ground-Truth für Aufgaben mit verformbaren Objekten.

HF Daily Papers·1d ago
Forschung

IBM testet, wie viel Gedächtnis KI-Agenten brauchen

ALTK-Evolve-Studie zeigt: Zugewinne durch Agentengedächtnis hängen von Modellleistung und Auslieferungsstrategie ab.

Hugging Face·1d ago
Forschung

Forschende stellen TTP-D für die Routenplanung mit Lkw und Drohnen vor

Der neue Benchmark kombiniert Artikelauswahl, lastabhängige Routenführung und Drohnensynchronisierung.

arXiv cs.AI+1 outlet·2d ago
Forschung

Studie: Audit-Reparatur-Kontext macht LLM-Prüfer nachsichtiger

Das arXiv-Paper berichtet von weniger Fehlalarmen, wenn zuvor Audit-Reparatur-Episoden im Modellkontext standen.

arXiv cs.AI+1 outlet·2d ago
Forschung

AlphaEvolve senkt Schranke für Matrixmultiplikation

Eine neue arXiv-Notiz meldet eine verbesserte obere Schranke für den Exponenten der Matrixmultiplikation.

arXiv cs.AI+1 outlet·2d ago
Forschung

Lernen, was noch fehlt, nicht was bereits beherrscht wird: sättigungsbewusste Advantage-Neugewichtung für Policy-Optimierung mit mehreren Rewards

arXiv:2608.

arXiv cs.AI+1 outlet·2d ago
Forschung

TRACE-Bench nimmt Bildgenerierung mit mehreren Referenzen ins Visier

Der Benchmark zerlegt Prompts in vier Operatoren, um Modellfehler zu diagnostizieren.

arXiv cs.AI+1 outlet·2d ago
Forschung

Forscher bringen generative Bewegungsmodelle voran

Zwei Arbeiten zielen mit neuronalen Ansätzen auf Bewegungsplanung und Bewegungsverstehen.

arXiv cs.AI+1 outlet·2d ago
Forschung

Forscher passen OPD für effizienteres Video-Reasoning an

Zwei Arbeiten nutzen Distillation-Techniken, um kleinere oder Streaming-Modelle für Videoverständnis zu verbessern.

arXiv cs.AI+1 outlet·2d ago
Forschung

Forschende schlagen RUPA für Unsicherheit bei LLM-Agenten vor

Das Framework schätzt die Zuversicht über vollständige Agenten-Trajektorien hinweg, nicht nur für einzelne lokale Schritte.

arXiv cs.CL+1 outlet·2d ago
Forschung

Neue Arbeiten zielen auf das Training von LLM-Agenten mit langem Planungshorizont

Forschende stellen TRCA, RLCascadeRouter und Agentic ESOpt für Agenten-Credit, Routing und Fine-Tuning vor.

arXiv cs.AI+1 outlet·2d ago
Forschung

Neue Studien kartieren Serving-Anforderungen für agentische KI

Vier Papers untersuchen Latenz, Caching, Traces und Edge-Serving für agentische LLM-Workloads.

arXiv cs.AI+1 outlet·2d ago
Forschung

Paper vereinheitlicht Graph Neural Networks in einer einzigen Layer-Gleichung

Das Framework ordnet GNN-Architekturen sieben rechnerischen Komponenten zu.

arXiv cs.LG+1 outlet·2d ago
Forschung

Forscher nehmen kompositionelle Bild- und Videobearbeitung ins Visier

Neue Paper schlagen Trainingsdaten und Destillationsmethoden für einheitliche Generierungs- und Bearbeitungsmodelle vor.

arXiv cs.CL+1 outlet·2d ago
Forschung

StartupBench testet Agenten anhand von Startup-Workflows

Der Benchmark bewertet durchgängige Agentenarbeit, abgeleitet aus am Markt validierten KI-Produkten.

HF Daily Papers+1 outlet·2d ago
Forschung

Forschende schlagen aDSL für agentische 3D-Erstellung vor

Das Paper kombiniert eine agentenorientierte 3D-Sprache mit einem trainingsfreien Multi-Agenten-Workflow.

HF Daily Papers·2d ago
Forschung

Abra-Studie kartiert Skalierungsgesetze für das Training von Diffusionsbildern

HF Daily Papers hebt eine Studie zur Compute-Skalierung von Text-zu-Bild-Diffusionsmodellen hervor.

HF Daily Papers+1 outlet·2d ago
Forschung

GS-Voxel zielt auf großskalige 3DGS-Generierung aus der Luft

Das Framework wandelt voroptimierte 3D-Gaussian-Szenen ohne szenenspezifisches Fitting in dünn besetzte, strukturierte Latents um.

HF Daily Papers·2d ago
Forschung

Paper schlägt fähigkeitszentriertes Datendesign für Bildgenerierung vor

Das Framework organisiert Trainingsdaten für die Bildgenerierung entlang von Abhängigkeiten zwischen Fähigkeiten.

HF Daily Papers+1 outlet·2d ago
Forschung

Forschende stellen ASI-Bench für autonome Wissenschaft vor

Der Benchmark testet innovative Exploration und wissenschaftliche Umsetzung anhand von 60 Forschungsaufgaben.

HF Daily Papers+1 outlet·2d ago
Forschung

Studie testet DeepSeek Harness gegen Prompt Injection

Eine Zusammenfassung von HF Daily Papers berichtet über 14.560 kontrollierte Ausführungen in 16 Kanälen für indirekte Inhalte.

HF Daily Papers·2d ago
Forschung

Neue Studien nehmen speicherbasierte verkörperte Navigation ins Visier

UniWM und TAMP-Nav schlagen unterschiedliche Wege vor, visuelle Vorhersage, Gedächtnis und Handeln in Navigationsagenten aufeinander abzustimmen.

HF Daily Papers+1 outlet·2d ago
Forschung

EditBridge nimmt Bildbearbeitung in ultrahoher Auflösung ins Visier

Die Diffusion-Bridge-Methode soll Quelldetails bewahren, während niedrig aufgelöste Bearbeitungen verfeinert werden.

HF Daily Papers·2d ago
Forschung

Forschende nehmen MoE-Latenz bei Vision und Decoding ins Visier

Neue Papers schlagen MoE-Vision-Encoder, schnelleres Small-Batch-Decoding und Online-Lastverteilung vor.

HF Daily Papers+1 outlet·2d ago
Forschung

MoE-ViE zielt auf effiziente Skalierung von Vision Encodern

Das Paper untersucht MoE-Designs für CLIP-artige Vision Encoder zur Bild- und Videoanalyse.

HF Daily Papers·2d ago
Forschung

InternLM schlägt Mobius-Modellarchitektur vor

Das arXiv-Paper trennt Gedächtnis und Schlussfolgern, um Kompression und Inferenz effizienter zu machen.

r/LocalLLaMA+1 outlet·2d ago
Forschung

R^3-Bench testet LLM-Schlussfolgern unter gemeinsamen Budgets

Der Benchmark bewertet sechs Modelle über Aufgabensuiten hinweg bei begrenzter Rechenzeit.

HF Daily Papers+1 outlet·3d ago
Forschung

ClawGym II zielt auf Black-Box-RL für Agent-Harnesses

Das Paper schlägt sandboxed Rollouts und Trajektorien-Rekonstruktion vor, um Agenten durch komplexe Harnesses hindurch zu trainieren.

HF Daily Papers+1 outlet·3d ago
Forschung

GenRouter leitet Bildgenerierungs-Prompts an günstigere Workflows weiter

Das Framework standardisiert agentische Bild-Pipelines und routet Prompts passend zu den Anforderungen der Aufgabe.

HF Daily Papers·3d ago
Forschung

Ventor-QTest prüft von Anbietern gehostete LLM-APIs

Das Paper schlägt eine Black-Box-Methode vor, um Fidelity-Verluste in gehosteten APIs für Open-Weight-Modelle zu testen.

HF Daily Papers+1 outlet·3d ago
Forschung

HarnessEval-W ergänzt agentenbasierte Tests für World Models

Die Benchmark-Pipeline nutzt Subagenten, um Rollouts anhand nachvollziehbarer Begründungsketten zu bewerten.

HF Daily Papers·3d ago
Forschung

Studie trainiert schnellere Pixel-Space-Diffusionsmodelle

HF Daily Papers hebt ein Latent-to-Pixel-Rezept für das Training von Text-zu-Bild-Diffusionsmodellen hervor.

HF Daily Papers·3d ago
Forschung

AnyTalk erzeugt Sprachanimationen ohne Animationsdaten

Die Methode passt Video-Diffusionsmodelle an, um lippensynchrone 3D-Sprachanimationen für Charaktere zu erstellen.

HF Daily Papers·3d ago
Forschung

HiFi-BRep zielt auf robustere B-Rep-Generierung

Das Framework nutzt topologiebewusste Kodierung und paralleles Dekodieren, um CAD-Grenzrepräsentationen zu verbessern.

HF Daily Papers·3d ago
Forschung

GRNEdit schlägt leichtgewichtiges instruktionsbasiertes Video-Editing vor

Das Paper beschreibt Video-Edits als Beibehalten-oder-Umschalten-Entscheidungen über binäre visuelle Codes.

HF Daily Papers+1 outlet·3d ago
Forschung

Forscher verlagern Diffusionsmodelle in den Pixelraum

Zwei Papers schlagen Diffusionsverfahren im Pixelraum für Bildrestaurierung und Text-zu-Bild-Generierung vor.

HF Daily Papers·3d ago
Forschung

KI-Entwicklertools und Arbeitsweisen lösen Debatte auf Hacker News aus

Beiträge zu MathCode, KI-Coding-Gewohnheiten, Cloudflare und Googles HEIR prägten die Diskussion.

Hacker News+5 outlets·3d ago
Forschung

Google treibt private KI mit homomorpher Verschlüsselung voran

Google will private KI mithilfe homomorpher Verschlüsselung praxistauglicher machen.

Hacker News+8 outlets·3d ago
Forschung

Google will private KI praxistauglich machen

Ein Beitrag im Google Security Blog sorgte auf Hacker News für Diskussionen, flankiert von breiterer Kritik an KI.

Hacker News+5 outlets·3d ago
Forschung

Forscher veröffentlichen LittleLearner für kontrollierte LLM-Studien

Das Modell mit 5 Milliarden Parametern wird auf einem Curriculum-Korpus mit 88 Milliarden Tokens trainiert, der Stoff bis einschließlich fünfter Klasse umfasst.

r/LocalLLaMA+1 outlet·3d ago
Forschung

HN diskutiert über KI-Grenzen, Datenschutz und wissenschaftliche Behauptungen

Beiträge zu Wirkstoffforschung, Mathematik, Datenschutz und KI-Laboren sorgten auf Hacker News für rege Diskussionen.

Hacker News+11 outlets·4d ago
Forschung

Neue Berichte prüfen KI-Versprechen in Wissenschaft und Arbeitswelt

Diskussionen auf Hacker News rückten Belege zu KI in der Wirkstoffforschung, Mathematik und ChatGPT-Nutzung in den Fokus.

Hacker News+2 outlets·4d ago
Forschung

Forscher nehmen Lücken im räumlichen Schlussfolgern von VLMs ins Visier

Neue Arbeiten schlagen Speicher, RL und Benchmarks für räumliche Intelligenz in Vision-Language-Systemen vor.

arXiv cs.AI+1 outlet·5d ago
Forschung

Google startet Gemini 3.7 Flash für Coding und Agents

Das neue Flash-Modell ist in der Gemini API, in Google AI Studio, Android Studio und Enterprise-Tools verfügbar.

Hacker News+13 outlets·5d ago