AAI News Hub
研究Thu, August 6, 2026·Aug 62 家媒体交叉佐证

CalibForge 用求解器行为校准终端任务

该系统生成了 5,431 个任务,并在终端和编程基准测试中提升了智能体得分。

为什么重要

这项工作瞄准了训练终端智能体的一个核心瓶颈:如何创建可执行、可验证且难度适合学习的任务。其在 Terminal-Bench 2.0、SWE-bench Pro 和 Doc2Repo 上报告的提升表明,相对于求解器进行任务校准,可能比单纯依赖验证提供更有效的监督。

核心要点

  • 1.CalibForge 生成了 5,431 个经过校准的终端任务。
  • 2.该方法利用求解器行为来修订任务难度。
  • 3.报告显示,Doc2Repo 上的提升达到 30.04 分。

研究人员推出了 CalibForge,这是一套自主系统,可利用经过验证的求解器行为来合成终端智能体训练任务。该方法通过对抗式求解器校准来修订候选任务,包括多求解器分歧,以及强模型通过、弱模型失败的对比式校准。CalibForge 生成了 5,431 个经过校准的终端任务,使用该数据集训练的模型在 Terminal-Bench 2.0 上分别达到 32.58% 和 47.57%。

今天就能用

在设计终端智能体训练数据,或仅依赖可执行验证之前,应先阅读 CalibForge 论文。

来源与原始报道

本简报汇总并链接到以下媒体的报道。

觉得这篇简报有用?下一篇直接送到你的邮箱。

更多 研究