Pesquisadores miram riscos de injeção de prompt em agentes de LLM
Dois artigos propõem métodos de defesa adaptativa e red teaming automatizado contra injeção de prompt em agentes.
Por que importa
O trabalho reflete uma mudança: de respostas pontuais à injeção de prompt para sistemas que aprendem estratégias de ataque ou defesa ao longo de sucessivos encontros. Isso é importante à medida que agentes de LLM assumem tarefas pouco especificadas, nas quais instruções maliciosas podem explorar ambiguidades na intenção do usuário.
Pontos-chave
- 1.O AgentAntibody se concentra em defesa adaptativa contra injeção de prompt para agentes de LLM.
- 2.O PIMiner automatiza o red teaming de injeção de prompt com estratégias de ataque transferíveis.
- 3.Ambos os artigos apresentam o aprendizado persistente como elemento central para a segurança de agentes.
Dois relatórios de pesquisa abordam ameaças de injeção de prompt contra agentes de LLM. O AgentAntibody propõe uma biblioteca persistente e autoevolutiva de “anticorpos” que aprende os limites de segurança de um usuário a partir de interações anteriores e os aplica em tempo de execução. O PIMiner propõe um sistema agêntico de red teaming que constrói uma biblioteca de estratégias durante o treinamento e a transfere para LLMs-alvo ainda não vistos, usando um pequeno número de consultas por amostra de teste.
⚡ Experimente hoje
Leia esses artigos antes de implantar agentes de LLM que lidem com conteúdo externo ou tarefas de usuário pouco especificadas.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
Pesquisadores propõem modelo de difusão para remover reflexos em vídeos
O S2R combina simulação física de reflexos com um modelo de difusão para remoção em vídeo e um benchmark.
Artigo defende que a segurança de agentes precisa de contratos em tempo de execução
O artigo no arXiv afirma que o alinhamento durante o treinamento é insuficiente para agentes autônomos.
Pesquisadores testam estruturas criadas por IA para modelos mais fracos
Um modelo mais forte criou scaffolds em tempo de inferência que elevaram as pontuações de modelos mais fracos em benchmarks de Theory-of-Mind.