AAI News Hub
ForschungThu, August 6, 2026·Aug 62 sources corroborating

CalibForge kalibriert Terminal-Aufgaben anhand des Solver-Verhaltens

Das System erzeugte 5.431 Aufgaben und verbesserte Agenten-Scores in Terminal- und Coding-Benchmarks.

Warum es wichtig ist

Die Arbeit adressiert einen zentralen Engpass beim Training von Terminal-Agenten: Aufgaben zu erstellen, die ausführbar, überprüfbar und für das Lernen angemessen schwierig sind. Die berichteten Zugewinne auf Terminal-Bench 2.0, SWE-bench Pro und Doc2Repo deuten darauf hin, dass solver-relative Aufgabenkalibrierung die Supervision über reine Validierung hinaus verbessern kann.

Die Kernpunkte

  • 1.CalibForge generierte 5.431 kalibrierte Terminal-Aufgaben.
  • 2.Der Ansatz nutzt Solver-Verhalten, um den Schwierigkeitsgrad von Aufgaben zu überarbeiten.
  • 3.Die berichteten Zugewinne erreichten 30,04 Punkte auf Doc2Repo.

Forschende haben CalibForge vorgestellt, ein autonomes System zur Synthese von Trainingsaufgaben für Terminal-Agenten auf Basis verifizierten Solver-Verhaltens. Die Methode überarbeitet Aufgabenentwürfe durch adversarielle Solver-Kalibrierung, darunter Uneinigkeit zwischen mehreren Solvern sowie kontrastive Kalibrierung nach dem Muster Strong-Pass/Weak-Fail. CalibForge erstellte 5.431 kalibrierte Terminal-Aufgaben; Modelle, die auf dieser Sammlung trainiert wurden, erreichten 32,58 % und 47,57 % auf Terminal-Bench 2.0.

Heute ausprobieren

Lesen Sie das CalibForge-Paper, bevor Sie Trainingsdaten für Terminal-Agenten entwerfen oder sich allein auf ausführbare Validierung verlassen.

Quellen & Originalberichte

Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.

Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.

Mehr in Forschung