CalibForge calibre les tâches en terminal à partir du comportement des solveurs
Le système a généré 5 431 tâches et amélioré les scores des agents sur des benchmarks de terminal et de codage.
Pourquoi c'est important
Ces travaux s’attaquent à un goulot d’étranglement central dans l’entraînement des agents en terminal : créer des tâches exécutables, vérifiables et d’une difficulté adaptée à l’apprentissage. Les gains rapportés sur Terminal-Bench 2.0, SWE-bench Pro et Doc2Repo suggèrent que la calibration des tâches par rapport aux solveurs peut améliorer la supervision au-delà de la seule validation.
Points clés
- 1.CalibForge a généré 5 431 tâches terminal calibrées.
- 2.L’approche utilise le comportement des solveurs pour ajuster la difficulté des tâches.
- 3.Les gains rapportés ont atteint 30,04 points sur Doc2Repo.
Des chercheurs ont présenté CalibForge, un système autonome qui synthétise des tâches d’entraînement pour agents en terminal à partir du comportement vérifié de solveurs. La méthode révise les tâches candidates grâce à une calibration adversariale des solveurs, notamment via le désaccord entre plusieurs solveurs et une calibration contrastive entre réussite forte et échec faible. CalibForge a produit 5 431 tâches terminal calibrées, et les modèles entraînés sur cet ensemble ont atteint 32,58 % et 47,57 % sur Terminal-Bench 2.0.
⚡ À tester aujourd'hui
Consultez l’article CalibForge avant de concevoir des données d’entraînement pour agents en terminal ou de vous appuyer uniquement sur la validation exécutable.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
- arXiv cs.AIRecursive Synthesis for Long-Horizon Terminal TasksAug 7, 12:00 PM↗
- arXiv cs.LGRecursive Synthesis for Long-Horizon Terminal TasksAug 7, 12:00 PM↗
- arXiv cs.LGCalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal TasksAug 7, 12:00 PM↗
- arXiv cs.CLCalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal TasksAug 7, 12:00 PM↗
- HF Daily PapersCalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal TasksAug 6, 4:00 AM↗
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
Une étude montre que le contexte d’audit-réparation rend les vérificateurs LLM plus indulgents
L’article publié sur arXiv fait état de moins de fausses alertes après des épisodes antérieurs d’audit-réparation dans le contexte du modèle.
AlphaEvolve contribue à abaisser la borne de la multiplication matricielle
Une nouvelle note publiée sur arXiv fait état d’une borne supérieure améliorée pour l’exposant de la multiplication matricielle.
InternLM propose l’architecture de modèle Mobius
L’article publié sur arXiv sépare mémoire et raisonnement afin d’améliorer la compression et l’efficacité de l’inférence.