PolicyGuide orienta agentes de LLM por fluxos de trabalho em conformidade
O sistema de pesquisa transforma políticas de domínio em grafos de workflow para guiar o comportamento de agentes em múltiplas etapas.
Por que importa
O trabalho mira um problema central na implantação de agentes de IA: seguir exigências procedurais, não apenas bloquear ações proibidas. Ele sugere que a conformidade com políticas pode exigir estado e remediação no nível do workflow, em vez de depender apenas de verificações em tempo de execução limitadas a ações individuais.
Pontos-chave
- 1.Compila políticas de domínio em grafos de workflow para orientar agentes.
- 2.Melhorou a média do Pass^4 de 0,42 para 0,62 no τ^2-bench.
- 3.Workflows foram transferidos para agentes Claude Sonnet 4.6 e Gemini 2.5 Pro.
PolicyGuide é um sistema proposto para agentes de LLM de atendimento ao cliente que compila políticas organizacionais em grafos de workflow e usa um verificador proativo nos limites de cada turno do usuário. Em testes do τ^2-bench nos setores aéreo, varejo e telecom, com um agente e um verificador GPT-5.4, elevou a média do Pass^4 de 0,42 para 0,62, com o maior ganho em telecom, de 0,19 para 0,61. Os mesmos workflows foram transferidos para agentes Claude Sonnet 4.6 e Gemini 2.5 Pro.
⚡ Experimente hoje
Leia o paper antes de implantar agentes de atendimento ao cliente que precisam seguir políticas organizacionais de múltiplas etapas.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
- arXiv cs.LGPolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM AgentsAug 21, 12:00 PM↗
- arXiv cs.CLPolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM AgentsAug 21, 12:00 PM↗
- HF Daily PapersPolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM AgentsAug 20, 4:00 AM↗
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
Google DeepMind faz parceria com estúdios de games em jogabilidade com IA
O laboratório afirma que está se apoiando em 15 anos de pesquisa em games para criar protótipos de jogabilidade com IA.
MemTrapBench testa armadilhas cognitivas no uso de memória por LLMs
O benchmark mostra que a memória pode prejudicar o desempenho em tarefas mesmo quando os registros recuperados são relevantes.
AI4AI-Bench testa agentes no design de algoritmos de treinamento
O benchmark no arXiv avalia se agentes de LLM conseguem reescrever algoritmos de treinamento em repositórios congelados.