AAI News Hub
ForschungFri, August 7, 2026·Aug 72 sources corroborating

Forscher stellen HarnessOpt-Bench für LLM-Agenten vor

Der Benchmark testet, wie gut LLMs Agent-Harnesses unter festen Evaluationsbudgets verbessern können.

Warum es wichtig ist

Die Arbeit verlagert die Evaluation weg von reinen Modellgewichten hin zu den Prompts, Tools, Kontrollflüssen, Speichermechanismen und Orchestrierungscode, die die Leistung von Agenten prägen. Sie bietet ein gemeinsames Protokoll, um zu messen, ob Frontier-LLMs Agentensysteme durch Harness-Änderungen unter realistischen Evaluationsbeschränkungen verbessern können.

Die Kernpunkte

  • 1.HarnessOpt-Bench bewertet die End-to-End-Optimierung von Harnesses für LLM-Agenten.
  • 2.Die Bewertung nutzt den normalisierten Zugewinn gegenüber einem Seed-Harness auf zurückgehaltenen Tests.
  • 3.Der Benchmark umfasst Ausführungskontrollen für Audits und Ressourcenmessung.

Forscher haben HarnessOpt-Bench vorgestellt, einen Benchmark zur Bewertung automatisierter Harness-Optimierung in LLM-basierten Agentensystemen. In diesem Setup erhält ein LLM-Optimierer das Seed-Harness eines Zielagenten, bewertetes Evaluationsfeedback und ein festes Evaluationsbudget, bearbeitet anschließend das Harness und reicht einen finalen Kandidaten ein. Bewertet wird der Kandidat anhand des normalisierten Zugewinns gegenüber dem Seed auf einer zurückgehaltenen Testpartition; eine vertrauenswürdige Ausführungsumgebung setzt Evaluationsgrenzen durch, misst die Ressourcennutzung und bewahrt Versionen für Audits auf.

Heute ausprobieren

Nutzen Sie zurückgehaltene Tests und Ressourcenmessung, wenn Sie mit automatisierter Optimierung von Prompts, Tools oder Agenten-Orchestrierung experimentieren.

Quellen & Originalberichte

Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.

Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.

Mehr in Forschung