AAI News Hub
RechercheThu, August 6, 2026·Aug 62 sources corroborating

CalibForge calibre les tâches en terminal à partir du comportement des solveurs

Le système a généré 5 431 tâches et amélioré les scores des agents sur des benchmarks de terminal et de codage.

Pourquoi c'est important

Ces travaux s’attaquent à un goulot d’étranglement central dans l’entraînement des agents en terminal : créer des tâches exécutables, vérifiables et d’une difficulté adaptée à l’apprentissage. Les gains rapportés sur Terminal-Bench 2.0, SWE-bench Pro et Doc2Repo suggèrent que la calibration des tâches par rapport aux solveurs peut améliorer la supervision au-delà de la seule validation.

Points clés

  • 1.CalibForge a généré 5 431 tâches terminal calibrées.
  • 2.L’approche utilise le comportement des solveurs pour ajuster la difficulté des tâches.
  • 3.Les gains rapportés ont atteint 30,04 points sur Doc2Repo.

Des chercheurs ont présenté CalibForge, un système autonome qui synthétise des tâches d’entraînement pour agents en terminal à partir du comportement vérifié de solveurs. La méthode révise les tâches candidates grâce à une calibration adversariale des solveurs, notamment via le désaccord entre plusieurs solveurs et une calibration contrastive entre réussite forte et échec faible. CalibForge a produit 5 431 tâches terminal calibrées, et les modèles entraînés sur cet ensemble ont atteint 32,58 % et 47,57 % sur Terminal-Bench 2.0.

À tester aujourd'hui

Consultez l’article CalibForge avant de concevoir des données d’entraînement pour agents en terminal ou de vous appuyer uniquement sur la validation exécutable.

Sources et articles originaux

Ce brief résume et renvoie vers la couverture des médias ci-dessous.

Ce brief vous a plu ? Recevez le prochain par e-mail.

Plus dans Recherche