PolicyGuide、LLMエージェントをコンプライアンスに沿ったワークフローへ誘導
この研究システムは、分野別ポリシーをワークフローグラフに変換し、複数ステップにわたるエージェントの振る舞いを導く。
なぜ重要か
この研究は、AIエージェント導入における中核的な課題、つまり禁止行為をブロックするだけでなく、手続き上の要件に従わせることに焦点を当てている。ポリシー遵守には、アクション単位のランタイムチェックだけでなく、ワークフロー水準の状態管理と是正が必要になり得ることを示している。
要点
- 1.分野別ポリシーを、エージェント誘導用のワークフローグラフにコンパイルする。
- 2.τ^2-benchで平均Pass^4を0.42から0.62に改善した。
- 3.ワークフローはClaude Sonnet 4.6とGemini 2.5 Proのエージェントにも転用できた。
PolicyGuideは、カスタマーサービス向けLLMエージェントのために提案されたシステムで、組織のポリシーをワークフローグラフにコンパイルし、ユーザー発話の区切りでプロアクティブな検証器を用いる。τ^2-benchの航空、リテール、通信分野のテストでは、GPT-5.4のエージェントと検証器を使い、平均Pass^4を0.42から0.62へ引き上げた。最大の改善は通信分野で、0.19から0.61に上昇した。同じワークフローはClaude Sonnet 4.6とGemini 2.5 Proのエージェントにも転用できた。
⚡ 今日から使える
複数ステップの組織ポリシーに従う必要があるカスタマーサービスエージェントを導入する前に、この論文を読むべきだ。
出典・一次報道
本記事は以下の媒体の報道を要約し、リンクしています。
- arXiv cs.LGPolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM AgentsAug 21, 12:00 PM↗
- arXiv cs.CLPolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM AgentsAug 21, 12:00 PM↗
- HF Daily PapersPolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM AgentsAug 20, 4:00 AM↗
この記事が役に立ちましたか?次号をメールでお届けします。
関連: 研究
研究
Google DeepMind、AIゲームプレイでゲームスタジオと提携
同研究所は、15年にわたるゲーム研究を土台にAIゲームプレイのプロトタイプ開発を進めているという。
Google DeepMind·16h ago
研究
MemTrapBench、LLMの記憶利用に潜む認知的な落とし穴を検証
このベンチマークは、検索された記録が関連性のあるものでも、記憶がタスク性能を低下させ得ることを示した。
arXiv cs.LG+1 outlet·1d ago
研究
AI4AI-Bench、エージェントの訓練アルゴリズム設計能力を検証
arXivの新ベンチマークは、LLMエージェントが凍結されたリポジトリ群で訓練アルゴリズムを書き換えられるかを評価する。
arXiv cs.LG+1 outlet·1d ago