Forscher stellen HarnessOpt-Bench für LLM-Agenten vor
Der Benchmark testet, wie gut LLMs Agent-Harnesses unter festen Evaluationsbudgets verbessern können.
Warum es wichtig ist
Die Arbeit verlagert die Evaluation weg von reinen Modellgewichten hin zu den Prompts, Tools, Kontrollflüssen, Speichermechanismen und Orchestrierungscode, die die Leistung von Agenten prägen. Sie bietet ein gemeinsames Protokoll, um zu messen, ob Frontier-LLMs Agentensysteme durch Harness-Änderungen unter realistischen Evaluationsbeschränkungen verbessern können.
Die Kernpunkte
- 1.HarnessOpt-Bench bewertet die End-to-End-Optimierung von Harnesses für LLM-Agenten.
- 2.Die Bewertung nutzt den normalisierten Zugewinn gegenüber einem Seed-Harness auf zurückgehaltenen Tests.
- 3.Der Benchmark umfasst Ausführungskontrollen für Audits und Ressourcenmessung.
Forscher haben HarnessOpt-Bench vorgestellt, einen Benchmark zur Bewertung automatisierter Harness-Optimierung in LLM-basierten Agentensystemen. In diesem Setup erhält ein LLM-Optimierer das Seed-Harness eines Zielagenten, bewertetes Evaluationsfeedback und ein festes Evaluationsbudget, bearbeitet anschließend das Harness und reicht einen finalen Kandidaten ein. Bewertet wird der Kandidat anhand des normalisierten Zugewinns gegenüber dem Seed auf einer zurückgehaltenen Testpartition; eine vertrauenswürdige Ausführungsumgebung setzt Evaluationsgrenzen durch, misst die Ressourcennutzung und bewahrt Versionen für Audits auf.
⚡ Heute ausprobieren
Nutzen Sie zurückgehaltene Tests und Ressourcenmessung, wenn Sie mit automatisierter Optimierung von Prompts, Tools oder Agenten-Orchestrierung experimentieren.
Quellen & Originalberichte
Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.
- arXiv cs.AIHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 7, 12:00 PM↗
- arXiv cs.LGHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 7, 12:00 PM↗
- arXiv cs.CLHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 7, 12:00 PM↗
- arXiv cs.LGEvolveNet: Collaborative Harness Evolution for Agent Self-ImprovementAug 6, 12:00 PM↗
- HF Daily PapersHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 6, 4:00 AM↗
- arXiv cs.AIWeClawArena: An Auditable Sandbox and Benchmark for Cross-User Agents Collaboration and Security in Human-Centered Agent NetworksAug 5, 12:00 PM↗
Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.
Mehr in Forschung
Forscher nehmen Lücken im räumlichen Schlussfolgern von VLMs ins Visier
Neue Arbeiten schlagen Speicher, RL und Benchmarks für räumliche Intelligenz in Vision-Language-Systemen vor.
Neue Studien untersuchen räumliche Intelligenz in Vision AI
SpaRRTa, SMA und PinpointQA testen oder verbessern räumliches Schlussfolgern für visuelle und verkörperte KI-Systeme.
CW-BASS v2 zielt mit DINOv2 auf die Auswahl von Pseudo-Labels
Die Methode passt das Filtern für semi-supervisierte Segmentierung unter Foundation-Model-Teachers an.