AAI News Hub
PesquisaTue, August 18, 2026·2d ago

Estudo testa o DeepSeek Harness contra injeção de prompt

Resumo do HF Daily Papers relata 14.560 execuções controladas em 16 canais de conteúdo indireto.

Por que importa

Os resultados mostram que sistemas de agentes podem continuar vulneráveis quando conteúdo não confiável chega a resultados de ferramentas, contexto adicionado ou caminhos de política de chamada de ferramentas. O artigo aponta para a necessidade de controles entre conteúdo não confiável e ações sensíveis.

Pontos-chave

  • 1.14.560 execuções testaram a resistência do DeepSeek Harness à injeção de prompt.
  • 2.Unicode oculto no modo arquivo alcançou uma taxa de sucesso de ataque de 25,5%.
  • 3.Controles devem separar conteúdo não confiável de ações sensíveis.

Uma avaliação de segurança analisou a injeção indireta de prompt no DeepSeek Harness usando o AI-Infra-Guard para construir testes, entregar contaminação controlada, executar o harness, coletar rastros e avaliar os resultados. O estudo cobriu 14.560 execuções controladas em 16 canais de conteúdo indireto, modos de transporte por texto e arquivo, 35 objetivos de payload, uma linha de base não modificada e 12 métodos de ataque. As maiores taxas de sucesso de ataque observadas foram de 17,0% para ataques de falsa conclusão no modo texto, 25,5% para Unicode oculto no modo arquivo e 16,0% para o canal de skills no modo arquivo.

Experimente hoje

Audite fluxos de trabalho de agentes para identificar textos ou arquivos não confiáveis que cheguem a chamadas de ferramentas sensíveis, especialmente entradas com Unicode oculto e pelo canal de skills.

Fontes e reportagens originais

Este resumo sintetiza e linka a cobertura dos veículos abaixo.

Gostou deste resumo? Receba o próximo no seu e-mail.

Mais em Pesquisa