Des chercheurs proposent RST pour les tâches d’agents en terminal
Recursive Synthetic Terminal Tasks a généré 37 484 tâches vérifiées à partir de tâches initiales.
Pourquoi c'est important
Ces travaux s’attaquent à un goulot d’étranglement dans l’entraînement des agents en terminal : produire des tâches cohérentes de longue durée, avec des consignes, des environnements, des solutions et des vérificateurs alignés. Si l’approche est reproductible, la synthèse récursive vérifiée pourrait réduire le coût de constitution de jeux d’entraînement pour agents et de suites d’évaluation plus difficiles.
Points clés
- 1.RST a généré 37 484 tâches synthétiques pour agents en terminal.
- 2.Le coût annoncé était d’environ 0,05 dollar par tâche.
- 3.Le pass@4 de DeepSeek-V4-Pro est passé de 90 % à 2,5 % au fil des cycles.
Un article mis en avant par HF Daily Papers présente Recursive Synthetic Terminal Tasks, un cadre destiné à générer des tâches d’entraînement de longue durée pour agents en terminal. À partir de tâches initiales vérifiées, RST prolonge les solutions de référence, réaligne les vérificateurs et les consignes, valide les tâches dans de nouveaux sandboxes, puis réutilise les tâches acceptées lors des cycles suivants. En 15 cycles récursifs, le système a produit 37 484 tâches synthétiques pour environ 0,05 dollar par tâche, avec une difficulté croissante au fil des cycles.
⚡ À tester aujourd'hui
Lisez l’article avant de construire des benchmarks pour agents en terminal ou des pipelines d’entraînement synthétique.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
- arXiv cs.AIRecursive Synthesis for Long-Horizon Terminal TasksAug 7, 12:00 PM↗
- arXiv cs.LGRecursive Synthesis for Long-Horizon Terminal TasksAug 7, 12:00 PM↗
- arXiv cs.LGCalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal TasksAug 7, 12:00 PM↗
- arXiv cs.CLCalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal TasksAug 7, 12:00 PM↗
- HF Daily PapersCalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal TasksAug 6, 4:00 AM↗
- HF Daily PapersRecursive Synthesis for Long-Horizon Terminal TasksAug 5, 4:00 AM↗
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
Google fait progresser l’IA privée grâce au chiffrement homomorphe
Google affirme rendre l’IA privée plus concrètement utilisable grâce au chiffrement homomorphe.
Google affirme rendre l’IA privée praticable
Un billet de Google Security a suscité des discussions sur Hacker News, dans un contexte plus large de critiques de l’IA.
Des chercheurs publient LittleLearner pour étudier les LLM en environnement contrôlé
Ce modèle de 5 milliards de paramètres est entraîné sur LITTLECURRICULUM, un corpus pédagogique de 88 milliards de tokens limité au niveau CM2 ou inférieur.