CalibForge calibra tarefas de terminal com base no comportamento de solucionadores
O sistema gerou 5.431 tarefas e melhorou as pontuações de agentes em benchmarks de terminal e programação.
Por que importa
O trabalho mira um gargalo central no treinamento de agentes de terminal: criar tarefas que sejam executáveis, verificáveis e tenham dificuldade adequada para o aprendizado. Os ganhos relatados no Terminal-Bench 2.0, no SWE-bench Pro e no Doc2Repo sugerem que a calibração de tarefas relativa aos solucionadores pode melhorar a supervisão para além da validação isolada.
Pontos-chave
- 1.O CalibForge gerou 5.431 tarefas de terminal calibradas.
- 2.A abordagem usa o comportamento de solucionadores para ajustar a dificuldade das tarefas.
- 3.Os ganhos relatados chegaram a 30,04 pontos no Doc2Repo.
Pesquisadores apresentaram o CalibForge, um sistema autônomo para sintetizar tarefas de treinamento para agentes de terminal usando comportamento verificado de solucionadores. O método revisa tarefas candidatas por meio de calibração adversarial de solucionadores, incluindo discordância entre múltiplos solucionadores e calibração contrastiva entre solucionadores fortes que passam e fracos que falham. O CalibForge produziu 5.431 tarefas de terminal calibradas, e modelos treinados com essa coleção alcançaram 32,58% e 47,57% no Terminal-Bench 2.0.
⚡ Experimente hoje
Leia o paper do CalibForge antes de projetar dados de treinamento para agentes de terminal ou de depender apenas de validação executável.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
- arXiv cs.AIRecursive Synthesis for Long-Horizon Terminal TasksAug 7, 12:00 PM↗
- arXiv cs.LGRecursive Synthesis for Long-Horizon Terminal TasksAug 7, 12:00 PM↗
- arXiv cs.LGCalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal TasksAug 7, 12:00 PM↗
- arXiv cs.CLCalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal TasksAug 7, 12:00 PM↗
- HF Daily PapersCalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal TasksAug 6, 4:00 AM↗
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
Google avança em IA privada com criptografia homomórfica
O Google afirma estar tornando a IA privada mais prática com o uso de criptografia homomórfica.
Google diz que está tornando a IA privada viável
Uma publicação do Google Security gerou discussão no Hacker News em meio a críticas mais amplas à IA.
Pesquisadores lançam LittleLearner para estudo controlado de LLMs
O modelo de 5 bilhões de parâmetros foi treinado em um corpus curricular de 88 bilhões de tokens com conteúdo até o 5º ano.