研究者ら、ターミナルエージェント向けタスクにRSTを提案
Recursive Synthetic Terminal Tasksは、シードタスクから検証済みタスク37,484件を生成した。
なぜ重要か
この研究は、ターミナルエージェント訓練におけるボトルネック、すなわち指示、環境、解答、検証器が整合した一貫性のある長期タスクの作成に取り組むものだ。再現可能であれば、再帰的な検証済み合成は、エージェント訓練セットやより難度の高い評価スイートを構築するコストを下げる可能性がある。
要点
- 1.RSTは37,484件の合成ターミナルエージェントタスクを生成した。
- 2.報告されたコストはタスクあたり約0.05ドルだった。
- 3.DeepSeek-V4-Proのpass@4は、ラウンドを通じて90%から2.5%に低下した。
HF Daily Papersで取り上げられた論文が、長期的なターミナルエージェント訓練タスクを生成するためのフレームワーク「Recursive Synthetic Terminal Tasks」を紹介している。RSTは検証済みのシードタスクを出発点に、参照解を拡張し、検証器と指示を再調整し、新しいサンドボックスでタスクを検証し、採用されたタスクを後続ラウンドで再利用する。15回の再帰ラウンドを通じて、タスクあたり約0.05ドルで37,484件の合成タスクを生成し、ラウンドを重ねるにつれてタスクの難度は上昇した。
⚡ 今日から使える
ターミナルエージェントのベンチマークや合成訓練パイプラインを構築する前に、この論文を読むべきだ。
出典・一次報道
本記事は以下の媒体の報道を要約し、リンクしています。
- arXiv cs.AIRecursive Synthesis for Long-Horizon Terminal TasksAug 7, 12:00 PM↗
- arXiv cs.LGRecursive Synthesis for Long-Horizon Terminal TasksAug 7, 12:00 PM↗
- arXiv cs.LGCalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal TasksAug 7, 12:00 PM↗
- arXiv cs.CLCalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal TasksAug 7, 12:00 PM↗
- HF Daily PapersCalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal TasksAug 6, 4:00 AM↗
- HF Daily PapersRecursive Synthesis for Long-Horizon Terminal TasksAug 5, 4:00 AM↗
この記事が役に立ちましたか?次号をメールでお届けします。
関連: 研究
研究
Google、準同型暗号でプライベートAIを前進
Googleは、準同型暗号を活用してプライベートAIをより実用的にしようとしていると説明している。
Hacker News+8 outlets·12h ago
研究
Google、プライベートAIの実用化を進めていると説明
Google Securityの投稿がHacker Newsで議論を呼び、AI全般への批判とも並んだ。
Hacker News+5 outlets·12h ago
研究
研究者ら、LLMを制御下で研究するためのLittleLearnerを公開
50億パラメータのモデルは、小学5年生以下のカリキュラムに基づく880億トークンのコーパスで訓練された。
r/LocalLLaMA+1 outlet·18h ago