Novos estudos miram riscos de prompt injection em agentes de LLM
Pesquisas analisam defesas adaptativas, red teaming e caminhos de ataque robótico para sistemas de IA agêntica.
Por que importa
Os artigos refletem uma mudança: de tratar prompt injection como uma questão isolada de higiene de prompts para enxergá-lo como um problema de segurança no nível do agente, em que memória, ferramentas, módulos de percepção e coordenação multiagente criam superfícies de ataque mais amplas. Para agentes em produção, os achados reforçam que tanto testes quanto controles em tempo de execução são necessários antes que os sistemas ajam sobre conteúdo externo ou ambientes físicos.
Pontos-chave
- 1.Prompt injection continua sendo um risco central para agentes de LLM que usam ferramentas.
- 2.Novas defesas enfatizam aprendizado persistente e verificação seletiva.
- 3.Sistemas robóticos e multiagente podem amplificar a propagação de ataques.
Vários artigos novos e atualizados analisam riscos de prompt injection em agentes de LLM e possíveis defesas. O AgentAntibody propõe uma defesa persistente, baseada em experiência, que aprende ao longo do tempo o limite de segurança de um usuário, enquanto o SIEVE propõe verificações seletivas de integridade e escalonamento para prompt injection indireto em agentes que usam ferramentas. Outros trabalhos apresentam o PIMiner para red teaming automatizado de prompt injection e estudam como ataques podem se espalhar por sistemas robóticos multiagente baseados em LLM.
⚡ Experimente hoje
Audite fluxos de trabalho de agentes que leem conteúdo externo ou chamam ferramentas, e adicione testes de red team para prompt injection antes de ampliar a autonomia.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
- arXiv cs.AIAgentAntibody: An Adaptive Immune System for Defending LLM Agents against Prompt InjectionAug 6, 12:00 PM↗
- HF Daily PapersAgent Against Agent: An Agentic System for Automatic Prompt Injection Red TeamingAug 5, 4:00 AM↗
- arXiv cs.AIWhen Prompts Control Robots: Prompt Injection Attacks in Multi-Agent Robotic SystemsAug 4, 12:00 PM↗
- arXiv cs.AISIEVE: Selective Integrity Verification and Escalation for Defending LLM Agents against Indirect Prompt InjectionAug 4, 12:00 PM↗
- arXiv cs.AIWhen Prompts Control Robots: Prompt Injection Attacks in Multi-Agent Robotic SystemsAug 4, 12:00 PM↗
- arXiv cs.CLSIEVE: Selective Integrity Verification and Escalation for Defending LLM Agents against Indirect Prompt InjectionAug 4, 12:00 PM↗
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
Pesquisadores propõem modelo de difusão para remover reflexos em vídeos
O S2R combina simulação física de reflexos com um modelo de difusão para remoção em vídeo e um benchmark.
Artigo defende que a segurança de agentes precisa de contratos em tempo de execução
O artigo no arXiv afirma que o alinhamento durante o treinamento é insuficiente para agentes autônomos.
Pesquisadores testam estruturas criadas por IA para modelos mais fracos
Um modelo mais forte criou scaffolds em tempo de inferência que elevaram as pontuações de modelos mais fracos em benchmarks de Theory-of-Mind.