CalibForge、ソルバーの挙動をもとにターミナル課題を較正
このシステムは5,431件の課題を生成し、ターミナルおよびコーディングのベンチマークでエージェントのスコアを向上させた。
なぜ重要か
この研究は、ターミナルエージェントの訓練における中核的なボトルネック、すなわち実行可能で検証でき、学習に適した難度を持つ課題を作ることに取り組んでいる。Terminal-Bench 2.0、SWE-bench Pro、Doc2Repoで報告された性能向上は、ソルバーに相対化した課題較正が、検証だけに頼る場合を超えて教師信号を改善し得ることを示している。
要点
- 1.CalibForgeは5,431件の較正済みターミナル課題を生成した。
- 2.このアプローチはソルバーの挙動を使って課題の難度を修正する。
- 3.Doc2Repoでは最大30.04ポイントの改善が報告された。
研究者らは、検証済みのソルバー挙動を用いてターミナルエージェント向けの訓練課題を合成する自律システム、CalibForgeを発表した。この手法は、複数ソルバー間の不一致や、強いソルバーは通過し弱いソルバーは失敗するという対比的較正を含む、敵対的なソルバー較正を通じて候補課題を修正する。CalibForgeは5,431件の較正済みターミナル課題を生成し、そのコレクションで訓練されたモデルはTerminal-Bench 2.0で32.58%と47.57%に到達した。
⚡ 今日から使える
ターミナルエージェントの訓練データを設計する前、または実行可能な検証だけに頼る前に、CalibForgeの論文を確認したい。
出典・一次報道
本記事は以下の媒体の報道を要約し、リンクしています。
- arXiv cs.AIRecursive Synthesis for Long-Horizon Terminal TasksAug 7, 12:00 PM↗
- arXiv cs.LGRecursive Synthesis for Long-Horizon Terminal TasksAug 7, 12:00 PM↗
- arXiv cs.LGCalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal TasksAug 7, 12:00 PM↗
- arXiv cs.CLCalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal TasksAug 7, 12:00 PM↗
- HF Daily PapersCalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal TasksAug 6, 4:00 AM↗
この記事が役に立ちましたか?次号をメールでお届けします。
関連: 研究
研究
Google、準同型暗号でプライベートAIを前進
Googleは、準同型暗号を活用してプライベートAIをより実用的にしようとしていると説明している。
Hacker News+8 outlets·21h ago
研究
Google、プライベートAIの実用化を進めていると説明
Google Securityの投稿がHacker Newsで議論を呼び、AI全般への批判とも並んだ。
Hacker News+5 outlets·21h ago
研究
研究者ら、LLMを制御下で研究するためのLittleLearnerを公開
50億パラメータのモデルは、小学5年生以下のカリキュラムに基づく880億トークンのコーパスで訓練された。
r/LocalLLaMA+1 outlet·1d ago