AAI News Hub
PesquisaThu, August 6, 2026·Aug 62 sources corroborating

CalibForge calibra tarefas de terminal com base no comportamento de solucionadores

O sistema gerou 5.431 tarefas e melhorou as pontuações de agentes em benchmarks de terminal e programação.

Por que importa

O trabalho mira um gargalo central no treinamento de agentes de terminal: criar tarefas que sejam executáveis, verificáveis e tenham dificuldade adequada para o aprendizado. Os ganhos relatados no Terminal-Bench 2.0, no SWE-bench Pro e no Doc2Repo sugerem que a calibração de tarefas relativa aos solucionadores pode melhorar a supervisão para além da validação isolada.

Pontos-chave

  • 1.O CalibForge gerou 5.431 tarefas de terminal calibradas.
  • 2.A abordagem usa o comportamento de solucionadores para ajustar a dificuldade das tarefas.
  • 3.Os ganhos relatados chegaram a 30,04 pontos no Doc2Repo.

Pesquisadores apresentaram o CalibForge, um sistema autônomo para sintetizar tarefas de treinamento para agentes de terminal usando comportamento verificado de solucionadores. O método revisa tarefas candidatas por meio de calibração adversarial de solucionadores, incluindo discordância entre múltiplos solucionadores e calibração contrastiva entre solucionadores fortes que passam e fracos que falham. O CalibForge produziu 5.431 tarefas de terminal calibradas, e modelos treinados com essa coleção alcançaram 32,58% e 47,57% no Terminal-Bench 2.0.

Experimente hoje

Leia o paper do CalibForge antes de projetar dados de treinamento para agentes de terminal ou de depender apenas de validação executável.

Fontes e reportagens originais

Este resumo sintetiza e linka a cobertura dos veículos abaixo.

Gostou deste resumo? Receba o próximo no seu e-mail.

Mais em Pesquisa