HarnessOpt-Bench testet LLMs bei der Harness-Optimierung
Der Benchmark bewertet, wie LLMs Agenten-Prompts, Tools, Kontrollfluss und Orchestrierungscode verbessern.
Warum es wichtig ist
Die Arbeit zeigt, dass Leistungsgewinne bei Agenten zunehmend nicht nur über Modellgewichte, sondern auch über Prompts, Tools, Speicher und Orchestrierungscode betrachtet werden. Ein gemeinsamer Benchmark könnte Aussagen zur Harness-Optimierung über Frontier-LLMs und Agentensysteme hinweg besser vergleichbar machen.
Die Kernpunkte
- 1.HarnessOpt-Bench zielt auf die End-to-End-Optimierung von Agenten-Harnesses ab.
- 2.Die Bewertung nutzt den normalisierten Zugewinn gegenüber einem Ausgangs-Harness auf zurückgehaltenen Tests.
- 3.Vertrauenswürdige Ausführung misst den Ressourcenverbrauch und bewahrt Audit-Trails.
Forschende haben HarnessOpt-Bench vorgestellt, einen Benchmark, der misst, wie gut LLMs die Harnesses rund um agentische Systeme optimieren können. In dem Protokoll erhält ein LLM-Optimierer ein Ausgangs-Harness, bewertetes Evaluationsfeedback und ein festes Evaluationsbudget, bearbeitet das Harness und reicht einen finalen Kandidaten ein, der anhand des normalisierten Zugewinns auf einer zurückgehaltenen Testpartition bewertet wird. Der Benchmark nutzt eine vertrauenswürdige Ausführungsumgebung, um Evaluationsgrenzen durchzusetzen, den Ressourcenverbrauch des Zielagenten zu messen und Kandidatenversionen für Audits zu erhalten.
⚡ Heute ausprobieren
Verwenden Sie zurückgehaltene Tests und strikte Evaluationsgrenzen, wenn LLMs Agenten-Harnesses optimieren.
Quellen & Originalberichte
Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.
- arXiv cs.AIHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 7, 12:00 PM↗
- arXiv cs.LGHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 7, 12:00 PM↗
- arXiv cs.CLHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 7, 12:00 PM↗
- arXiv cs.LGEvolveNet: Collaborative Harness Evolution for Agent Self-ImprovementAug 6, 12:00 PM↗
- HF Daily PapersHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 6, 4:00 AM↗
Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.
Mehr in Forschung
Google testet AMIE für medizinische Videokonsultationen in Echtzeit
Das auf Gemini basierende Forschungssystem wurde in simulierten Telemedizin-Konsultationen evaluiert.
Anthropic-Modell bringt Arbeit an der Riemannschen Vermutung voran
Ein unveröffentlichtes Anthropic-Modell hat Fortschritte bei dem seit Langem ungelösten mathematischen Problem erzielt, berichtete TechCrunch.
IBM erläutert Agenten-Gedächtnismethode ALTK-Evolve
Das System ruft aufgabenspezifische Leitlinien ab, um gegenüber ACE Inference-Tokens zu sparen.