AAI News Hub
研究Tue, August 4, 2026·Aug 42 sources corroborating

OneDayAgent、長期的な自律エージェントのワークフローを検証

このハーネスは、104件のベンチマークタスクで、タスク分解、メモリ、検証を管理する。

なぜ重要か

この研究は、目標の逸脱、状態の喪失、コンテキストのあふれといった、エージェント型システムに残る失敗パターンに焦点を当てている。3つのモデルファミリーに属する5種類のバックエンドLLMで示された性能は、ハーネス設計が単一モデルに依存せず、長期的な信頼性を高めうることを示唆している。

要点

  • 1.OneDayAgentは、分解、メモリ、最終検証を管理する。
  • 2.GLM-5.2を用いた104件のAgentIF-OneDayタスクで0.821を記録した。
  • 3.このハーネスは、3つのモデルファミリーにまたがる5種類のLLMバックエンドで動作した。

研究者らは、仕事、学習、生活にまたがる自由度の高い日常的な依頼に対応する自律エージェント向けハーネス「OneDayAgent」を発表した。このシステムは依頼を範囲の限定されたサブタスクに分解し、コンテキスト圧迫下でも実行メモリを維持し、最終成果物を検証して修復する。AgentIF-OneDayでは104件のタスクで評価され、GLM-5.2をバックエンドに用いた場合、総合スコア0.821を達成した。

今日から使える

多くのステップを通じて目標、メモリ、成果物の品質を保つ必要がある長期的エージェントを設計する前に、この論文を読んでおきたい。

出典・一次報道

本記事は以下の媒体の報道を要約し、リンクしています。

この記事が役に立ちましたか?次号をメールでお届けします。

関連: 研究