연구진, 프롬프트 인젝션에 대한 DeepSeek Harness 내성 테스트
HF Daily Papers 요약에 따르면 16개 간접 콘텐츠 채널에서 14,560건의 통제 실행이 이뤄졌다.
왜 중요한가
이번 결과는 신뢰할 수 없는 콘텐츠가 도구 결과, 추가 컨텍스트 또는 도구 호출 정책 경로에 도달할 때 에이전트 시스템이 여전히 취약할 수 있음을 보여준다. 논문은 신뢰할 수 없는 콘텐츠와 민감한 작업 사이에 통제가 필요하다고 지적한다.
핵심 포인트
- 1.14,560건의 실행으로 DeepSeek Harness의 프롬프트 인젝션 내성을 테스트했다.
- 2.파일 모드의 숨겨진 Unicode는 25.5%의 공격 성공률을 기록했다.
- 3.통제 장치는 신뢰할 수 없는 콘텐츠와 민감한 작업을 분리해야 한다.
한 보안 평가가 AI-Infra-Guard를 사용해 테스트를 구성하고, 통제된 오염 입력을 전달하며, harness를 실행하고, 추적 데이터를 수집한 뒤 결과를 판정하는 방식으로 DeepSeek Harness의 간접 프롬프트 인젝션을 평가했다. 이 연구는 16개 간접 콘텐츠 채널, 텍스트 및 파일 전달 모드, 35개 페이로드 목표, 수정하지 않은 기준선 1개, 공격 기법 12개에 걸쳐 14,560건의 통제 실행을 다뤘다. 관찰된 공격 성공률이 가장 높았던 사례는 텍스트 모드의 가짜 완료 공격 17.0%, 파일 모드의 숨겨진 Unicode 25.5%, 파일 모드의 skills 채널 16.0%였다.
⚡ 오늘 바로 활용
민감한 도구 호출에 도달하는 신뢰할 수 없는 텍스트나 파일이 있는지 에이전트 워크플로를 감사해야 하며, 특히 숨겨진 Unicode와 skills 채널 입력에 주의해야 한다.
출처 및 원본 보도
이 브리핑은 아래 매체의 보도를 요약하고 링크합니다.
이 브리핑이 유용했나요? 다음 소식을 메일로 받아보세요.
관련: 연구
스타트업 “AI 암 치료 진전의 핵심은 데이터”
TechCrunch에 따르면 이 스타트업은 더 나은 데이터 없이는 AI가 암 치료에 가까워지지 못했다고 주장했다.
HarnessRisk, 에이전트 하네스 안전 실패를 벤치마크하다
이 벤치마크는 에이전트 하네스의 단계별 공격을 테스트하며, 관련 연구는 작업별 프로비저닝을 살핀다.
Agent Lightning v1.0, harness 기반 agentic RL 겨냥
이 프레임워크는 임의의 agent harness를 강화학습 기반 post-training에 연결한다.