AAI News Hub
연구Wed, August 19, 2026·19h ago2 sources corroborating

HarnessRisk, 에이전트 하네스 안전 실패를 벤치마크하다

이 벤치마크는 에이전트 하네스의 단계별 공격을 테스트하며, 관련 연구는 작업별 프로비저닝을 살핀다.

왜 중요한가

이번 결과는 에이전트 안전성이 모델의 동작뿐 아니라 하네스가 어떻게 구성되고 프로비저닝되는지에도 좌우된다는 점을 시사한다. 인프라와 같은 고위험 배포 환경에서는 하네스 접근 권한을 작업에 필요한 범위로 제한하는 것이 불필요한 노출을 줄이는 데 도움이 될 수 있다.

핵심 포인트

  • 1.HarnessRisk는 에이전트 하네스 운영의 여섯 단계를 다룬다.
  • 2.테스트한 구성 전반에서 공격 성공률은 12.6%에서 80.9%까지 나타났다.
  • 3.Harness Configuration은 가장 취약한 단계였다.

연구진은 도구, 상태, 권한, 외부 작업을 관리하는 LLM 에이전트 하네스의 안전 실패를 평가하기 위한 생애주기 중심 벤치마크 HarnessRisk를 공개했다. 이 벤치마크는 여섯 가지 운영 단계에 걸친 128개의 샌드박스 사례로 구성되며 Utility, Attack Success Rate, Persistence, Detection을 측정한다. 세 가지 하네스, 여섯 개 언어 모델, 14개 구성에서 공격 성공률은 12.6%에서 80.9%까지 나타났고 Utility는 75.0%에서 97.6% 범위였으며, Harness Configuration 단계가 가장 취약했다.

오늘 바로 활용

도구나 상태 접근을 확대하기 전에 에이전트 하네스의 구성과 권한을 감사하라.

출처 및 원본 보도

이 브리핑은 아래 매체의 보도를 요약하고 링크합니다.

이 브리핑이 유용했나요? 다음 소식을 메일로 받아보세요.

관련: 연구