AAI News Hub
연구Tue, August 18, 2026·2d ago

연구진, 프롬프트 인젝션에 대한 DeepSeek Harness 내성 테스트

HF Daily Papers 요약에 따르면 16개 간접 콘텐츠 채널에서 14,560건의 통제 실행이 이뤄졌다.

왜 중요한가

이번 결과는 신뢰할 수 없는 콘텐츠가 도구 결과, 추가 컨텍스트 또는 도구 호출 정책 경로에 도달할 때 에이전트 시스템이 여전히 취약할 수 있음을 보여준다. 논문은 신뢰할 수 없는 콘텐츠와 민감한 작업 사이에 통제가 필요하다고 지적한다.

핵심 포인트

  • 1.14,560건의 실행으로 DeepSeek Harness의 프롬프트 인젝션 내성을 테스트했다.
  • 2.파일 모드의 숨겨진 Unicode는 25.5%의 공격 성공률을 기록했다.
  • 3.통제 장치는 신뢰할 수 없는 콘텐츠와 민감한 작업을 분리해야 한다.

한 보안 평가가 AI-Infra-Guard를 사용해 테스트를 구성하고, 통제된 오염 입력을 전달하며, harness를 실행하고, 추적 데이터를 수집한 뒤 결과를 판정하는 방식으로 DeepSeek Harness의 간접 프롬프트 인젝션을 평가했다. 이 연구는 16개 간접 콘텐츠 채널, 텍스트 및 파일 전달 모드, 35개 페이로드 목표, 수정하지 않은 기준선 1개, 공격 기법 12개에 걸쳐 14,560건의 통제 실행을 다뤘다. 관찰된 공격 성공률이 가장 높았던 사례는 텍스트 모드의 가짜 완료 공격 17.0%, 파일 모드의 숨겨진 Unicode 25.5%, 파일 모드의 skills 채널 16.0%였다.

오늘 바로 활용

민감한 도구 호출에 도달하는 신뢰할 수 없는 텍스트나 파일이 있는지 에이전트 워크플로를 감사해야 하며, 특히 숨겨진 Unicode와 skills 채널 입력에 주의해야 한다.

출처 및 원본 보도

이 브리핑은 아래 매체의 보도를 요약하고 링크합니다.

이 브리핑이 유용했나요? 다음 소식을 메일로 받아보세요.

관련: 연구