AAI News Hub
研究Mon, August 3, 2026·Aug 3

LongHorizon-Harness、長期タスクを担うエージェントの状態管理に照準

この研究用ハーネスはタスク状態を実行から切り離し、監査ループで更新を検証する。

なぜ重要か

この研究は、長時間稼働するエージェントの中核的な失敗要因である、古い自己評価や誤った自己評価に起因するエラーの蓄積に取り組むものだ。明示的で独立検証された状態管理は、ツールを多用するワークフロー全体でエージェントシステムの信頼性を高める可能性がある。

要点

  • 1.LongHorizon-Harnessは、タスク状態を実行コンテキストの外に保存する。
  • 2.MEAループは、次のサブタスクに進む前に更新を検証する。
  • 3.報告されたベンチマーク上の改善には、WeaveBenchにおけるQwen 3.7-Plusの結果が含まれる。

研究者らは、長期タスクを扱うLLMエージェント向けのフレームワーク「LongHorizon-Harness」を提案した。モデルのコンテキストが膨らみ続ける中で、タスク状態をモデル外で管理する仕組みだ。Manage-Execute-Auditループでは、マネージャーがサブタスクを選び、新しいコンテキストの実行役が行動し、読み取り専用の監査役がタスク記録を更新する前に環境状態を検証する。論文では、WeaveBench、Terminal-Bench 2.1、OSWorld 2.0において、Qwen 3.7-Plusで性能向上が報告されている。

今日から使える

長期タスクを担うエージェントを構築する際は、タスク状態を実行コンテキストから切り離し、先へ進む前に状態変化を環境と照合して検証するべきだ。

出典・一次報道

本記事は以下の媒体の報道を要約し、リンクしています。

この記事が役に立ちましたか?次号をメールでお届けします。

関連: 研究