Forscher schlagen RST für Terminal-Agenten-Aufgaben vor
Recursive Synthetic Terminal Tasks erzeugte 37.484 verifizierte Aufgaben aus Seed-Aufgaben.
Warum es wichtig ist
Die Arbeit adressiert einen Engpass beim Training von Terminal-Agenten: die Erstellung konsistenter Aufgaben mit langem Zeithorizont, bei denen Anweisungen, Umgebungen, Lösungen und Prüfer aufeinander abgestimmt sind. Falls reproduzierbar, könnte rekursive verifizierte Synthese die Kosten für den Aufbau von Agenten-Trainingsdatensätzen und anspruchsvolleren Evaluationssuiten senken.
Die Kernpunkte
- 1.RST erzeugte 37.484 synthetisierte Terminal-Agenten-Aufgaben.
- 2.Die berichteten Kosten lagen bei rund 0,05 US-Dollar pro Aufgabe.
- 3.DeepSeek-V4-Pro pass@4 fiel über die Runden hinweg von 90 % auf 2,5 %.
Ein von HF Daily Papers hervorgehobenes Paper stellt Recursive Synthetic Terminal Tasks vor, ein Framework zur Generierung von Trainingsaufgaben mit langem Zeithorizont für Terminal-Agenten. Ausgehend von verifizierten Seed-Aufgaben erweitert RST Referenzlösungen, richtet Prüfer und Anweisungen neu aufeinander aus, validiert Aufgaben in frischen Sandboxes und nutzt angenommene Aufgaben für spätere Runden wieder. Über 15 rekursive Runden hinweg entstanden 37.484 synthetisierte Aufgaben zu Kosten von rund 0,05 US-Dollar pro Aufgabe, wobei die Schwierigkeit der Aufgaben im Verlauf der Runden zunahm.
⚡ Heute ausprobieren
Lesen Sie das Paper, bevor Sie Benchmarks für Terminal-Agenten oder synthetische Trainingspipelines entwickeln.
Quellen & Originalberichte
Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.
- arXiv cs.AIRecursive Synthesis for Long-Horizon Terminal TasksAug 7, 12:00 PM↗
- arXiv cs.LGRecursive Synthesis for Long-Horizon Terminal TasksAug 7, 12:00 PM↗
- arXiv cs.LGCalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal TasksAug 7, 12:00 PM↗
- arXiv cs.CLCalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal TasksAug 7, 12:00 PM↗
- HF Daily PapersCalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal TasksAug 6, 4:00 AM↗
- HF Daily PapersRecursive Synthesis for Long-Horizon Terminal TasksAug 5, 4:00 AM↗
Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.
Mehr in Forschung
Google treibt private KI mit homomorpher Verschlüsselung voran
Google will private KI mithilfe homomorpher Verschlüsselung praxistauglicher machen.
Google will private KI praxistauglich machen
Ein Beitrag im Google Security Blog sorgte auf Hacker News für Diskussionen, flankiert von breiterer Kritik an KI.
Forscher veröffentlichen LittleLearner für kontrollierte LLM-Studien
Das Modell mit 5 Milliarden Parametern wird auf einem Curriculum-Korpus mit 88 Milliarden Tokens trainiert, der Stoff bis einschließlich fünfter Klasse umfasst.