AAI News Hub
ForschungFri, August 7, 2026·4d ago2 sources corroborating

HarnessOpt-Bench testet LLMs bei der Harness-Optimierung

Der Benchmark bewertet, wie LLMs Agenten-Prompts, Tools, Kontrollfluss und Orchestrierungscode verbessern.

Warum es wichtig ist

Die Arbeit zeigt, dass Leistungsgewinne bei Agenten zunehmend nicht nur über Modellgewichte, sondern auch über Prompts, Tools, Speicher und Orchestrierungscode betrachtet werden. Ein gemeinsamer Benchmark könnte Aussagen zur Harness-Optimierung über Frontier-LLMs und Agentensysteme hinweg besser vergleichbar machen.

Die Kernpunkte

  • 1.HarnessOpt-Bench zielt auf die End-to-End-Optimierung von Agenten-Harnesses ab.
  • 2.Die Bewertung nutzt den normalisierten Zugewinn gegenüber einem Ausgangs-Harness auf zurückgehaltenen Tests.
  • 3.Vertrauenswürdige Ausführung misst den Ressourcenverbrauch und bewahrt Audit-Trails.

Forschende haben HarnessOpt-Bench vorgestellt, einen Benchmark, der misst, wie gut LLMs die Harnesses rund um agentische Systeme optimieren können. In dem Protokoll erhält ein LLM-Optimierer ein Ausgangs-Harness, bewertetes Evaluationsfeedback und ein festes Evaluationsbudget, bearbeitet das Harness und reicht einen finalen Kandidaten ein, der anhand des normalisierten Zugewinns auf einer zurückgehaltenen Testpartition bewertet wird. Der Benchmark nutzt eine vertrauenswürdige Ausführungsumgebung, um Evaluationsgrenzen durchzusetzen, den Ressourcenverbrauch des Zielagenten zu messen und Kandidatenversionen für Audits zu erhalten.

Heute ausprobieren

Verwenden Sie zurückgehaltene Tests und strikte Evaluationsgrenzen, wenn LLMs Agenten-Harnesses optimieren.

Quellen & Originalberichte

Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.

Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.

Mehr in Forschung