CalibForge kalibriert Terminal-Aufgaben anhand des Solver-Verhaltens
Das System erzeugte 5.431 Aufgaben und verbesserte Agenten-Scores in Terminal- und Coding-Benchmarks.
Warum es wichtig ist
Die Arbeit adressiert einen zentralen Engpass beim Training von Terminal-Agenten: Aufgaben zu erstellen, die ausführbar, überprüfbar und für das Lernen angemessen schwierig sind. Die berichteten Zugewinne auf Terminal-Bench 2.0, SWE-bench Pro und Doc2Repo deuten darauf hin, dass solver-relative Aufgabenkalibrierung die Supervision über reine Validierung hinaus verbessern kann.
Die Kernpunkte
- 1.CalibForge generierte 5.431 kalibrierte Terminal-Aufgaben.
- 2.Der Ansatz nutzt Solver-Verhalten, um den Schwierigkeitsgrad von Aufgaben zu überarbeiten.
- 3.Die berichteten Zugewinne erreichten 30,04 Punkte auf Doc2Repo.
Forschende haben CalibForge vorgestellt, ein autonomes System zur Synthese von Trainingsaufgaben für Terminal-Agenten auf Basis verifizierten Solver-Verhaltens. Die Methode überarbeitet Aufgabenentwürfe durch adversarielle Solver-Kalibrierung, darunter Uneinigkeit zwischen mehreren Solvern sowie kontrastive Kalibrierung nach dem Muster Strong-Pass/Weak-Fail. CalibForge erstellte 5.431 kalibrierte Terminal-Aufgaben; Modelle, die auf dieser Sammlung trainiert wurden, erreichten 32,58 % und 47,57 % auf Terminal-Bench 2.0.
⚡ Heute ausprobieren
Lesen Sie das CalibForge-Paper, bevor Sie Trainingsdaten für Terminal-Agenten entwerfen oder sich allein auf ausführbare Validierung verlassen.
Quellen & Originalberichte
Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.
- arXiv cs.AIRecursive Synthesis for Long-Horizon Terminal TasksAug 7, 12:00 PM↗
- arXiv cs.LGRecursive Synthesis for Long-Horizon Terminal TasksAug 7, 12:00 PM↗
- arXiv cs.LGCalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal TasksAug 7, 12:00 PM↗
- arXiv cs.CLCalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal TasksAug 7, 12:00 PM↗
- HF Daily PapersCalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal TasksAug 6, 4:00 AM↗
Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.
Mehr in Forschung
Studie: Audit-Reparatur-Kontext macht LLM-Prüfer nachsichtiger
Das arXiv-Paper berichtet von weniger Fehlalarmen, wenn zuvor Audit-Reparatur-Episoden im Modellkontext standen.
AlphaEvolve senkt Schranke für Matrixmultiplikation
Eine neue arXiv-Notiz meldet eine verbesserte obere Schranke für den Exponenten der Matrixmultiplikation.
InternLM schlägt Mobius-Modellarchitektur vor
Das arXiv-Paper trennt Gedächtnis und Schlussfolgern, um Kompression und Inferenz effizienter zu machen.