CalibForge 用求解器行为校准终端任务
该系统生成了 5,431 个任务,并在终端和编程基准测试中提升了智能体得分。
为什么重要
这项工作瞄准了训练终端智能体的一个核心瓶颈:如何创建可执行、可验证且难度适合学习的任务。其在 Terminal-Bench 2.0、SWE-bench Pro 和 Doc2Repo 上报告的提升表明,相对于求解器进行任务校准,可能比单纯依赖验证提供更有效的监督。
核心要点
- 1.CalibForge 生成了 5,431 个经过校准的终端任务。
- 2.该方法利用求解器行为来修订任务难度。
- 3.报告显示,Doc2Repo 上的提升达到 30.04 分。
研究人员推出了 CalibForge,这是一套自主系统,可利用经过验证的求解器行为来合成终端智能体训练任务。该方法通过对抗式求解器校准来修订候选任务,包括多求解器分歧,以及强模型通过、弱模型失败的对比式校准。CalibForge 生成了 5,431 个经过校准的终端任务,使用该数据集训练的模型在 Terminal-Bench 2.0 上分别达到 32.58% 和 47.57%。
⚡ 今天就能用
在设计终端智能体训练数据,或仅依赖可执行验证之前,应先阅读 CalibForge 论文。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
- arXiv cs.AIRecursive Synthesis for Long-Horizon Terminal TasksAug 7, 12:00 PM↗
- arXiv cs.LGRecursive Synthesis for Long-Horizon Terminal TasksAug 7, 12:00 PM↗
- arXiv cs.LGCalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal TasksAug 7, 12:00 PM↗
- arXiv cs.CLCalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal TasksAug 7, 12:00 PM↗
- HF Daily PapersCalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal TasksAug 6, 4:00 AM↗
觉得这篇简报有用?下一篇直接送到你的邮箱。