Estudo testa o DeepSeek Harness contra injeção de prompt
Resumo do HF Daily Papers relata 14.560 execuções controladas em 16 canais de conteúdo indireto.
Por que importa
Os resultados mostram que sistemas de agentes podem continuar vulneráveis quando conteúdo não confiável chega a resultados de ferramentas, contexto adicionado ou caminhos de política de chamada de ferramentas. O artigo aponta para a necessidade de controles entre conteúdo não confiável e ações sensíveis.
Pontos-chave
- 1.14.560 execuções testaram a resistência do DeepSeek Harness à injeção de prompt.
- 2.Unicode oculto no modo arquivo alcançou uma taxa de sucesso de ataque de 25,5%.
- 3.Controles devem separar conteúdo não confiável de ações sensíveis.
Uma avaliação de segurança analisou a injeção indireta de prompt no DeepSeek Harness usando o AI-Infra-Guard para construir testes, entregar contaminação controlada, executar o harness, coletar rastros e avaliar os resultados. O estudo cobriu 14.560 execuções controladas em 16 canais de conteúdo indireto, modos de transporte por texto e arquivo, 35 objetivos de payload, uma linha de base não modificada e 12 métodos de ataque. As maiores taxas de sucesso de ataque observadas foram de 17,0% para ataques de falsa conclusão no modo texto, 25,5% para Unicode oculto no modo arquivo e 16,0% para o canal de skills no modo arquivo.
⚡ Experimente hoje
Audite fluxos de trabalho de agentes para identificar textos ou arquivos não confiáveis que cheguem a chamadas de ferramentas sensíveis, especialmente entradas com Unicode oculto e pelo canal de skills.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
Startup diz que dados são essenciais para avanços da IA contra o câncer
Segundo o TechCrunch, a startup afirma que a IA ainda não está perto de curar o câncer sem dados melhores.
HarnessRisk mede falhas de segurança em harnesses de agentes
O benchmark testa ataques em diferentes fases de harnesses de agentes, enquanto trabalhos relacionados analisam provisionamento específico por tarefa.
Agent Lightning v1.0 mira RL agêntico com harness
O framework conecta harnesses arbitrários de agentes ao pós-treinamento por aprendizado por reforço.