AAI News Hub
연구Mon, August 3, 2026·Aug 3

LongHorizon-Harness, 장기 실행 에이전트 상태 관리 겨냥

이 연구용 하니스는 작업 상태와 실행을 분리하고, 감사 루프를 통해 업데이트를 검증한다.

왜 중요한가

이 연구는 장시간 실행되는 에이전트의 핵심 실패 요인인 오래되거나 잘못된 자기 평가에서 비롯되는 누적 오류를 다룬다. 명시적이고 독립적으로 검증된 상태 관리는 도구 사용이 많은 워크플로 전반에서 에이전트 시스템의 신뢰성을 높일 수 있다.

핵심 포인트

  • 1.LongHorizon-Harness는 작업 상태를 실행 컨텍스트 밖에 저장한다.
  • 2.MEA 루프는 다음 하위 작업으로 넘어가기 전에 업데이트를 검증한다.
  • 3.보고된 벤치마크 성과 향상에는 WeaveBench에서의 Qwen 3.7-Plus가 포함된다.

연구진은 모델의 점점 늘어나는 컨텍스트 밖에서 작업 상태를 관리하는 장기 실행 LLM 에이전트용 프레임워크 LongHorizon-Harness를 제안했다. 이 프레임워크의 Manage-Execute-Audit 루프는 매니저가 하위 작업을 선택하고, 새 컨텍스트의 실행자가 작업을 수행하며, 읽기 전용 감사자가 작업 기록을 업데이트하기 전에 환경 상태를 검증하는 방식으로 작동한다. 논문은 WeaveBench, Terminal-Bench 2.1, OSWorld 2.0에서 Qwen 3.7-Plus의 성능 향상을 보고했다.

오늘 바로 활용

장기 실행 에이전트를 구축할 때는 작업 상태를 실행 컨텍스트와 분리하고, 계속 진행하기 전에 상태 변경을 환경과 대조해 검증해야 한다.

출처 및 원본 보도

이 브리핑은 아래 매체의 보도를 요약하고 링크합니다.

이 브리핑이 유용했나요? 다음 소식을 메일로 받아보세요.

관련: 연구