LongHorizon-Harness, 장기 실행 에이전트 상태 관리 겨냥
이 연구용 하니스는 작업 상태와 실행을 분리하고, 감사 루프를 통해 업데이트를 검증한다.
왜 중요한가
이 연구는 장시간 실행되는 에이전트의 핵심 실패 요인인 오래되거나 잘못된 자기 평가에서 비롯되는 누적 오류를 다룬다. 명시적이고 독립적으로 검증된 상태 관리는 도구 사용이 많은 워크플로 전반에서 에이전트 시스템의 신뢰성을 높일 수 있다.
핵심 포인트
- 1.LongHorizon-Harness는 작업 상태를 실행 컨텍스트 밖에 저장한다.
- 2.MEA 루프는 다음 하위 작업으로 넘어가기 전에 업데이트를 검증한다.
- 3.보고된 벤치마크 성과 향상에는 WeaveBench에서의 Qwen 3.7-Plus가 포함된다.
연구진은 모델의 점점 늘어나는 컨텍스트 밖에서 작업 상태를 관리하는 장기 실행 LLM 에이전트용 프레임워크 LongHorizon-Harness를 제안했다. 이 프레임워크의 Manage-Execute-Audit 루프는 매니저가 하위 작업을 선택하고, 새 컨텍스트의 실행자가 작업을 수행하며, 읽기 전용 감사자가 작업 기록을 업데이트하기 전에 환경 상태를 검증하는 방식으로 작동한다. 논문은 WeaveBench, Terminal-Bench 2.1, OSWorld 2.0에서 Qwen 3.7-Plus의 성능 향상을 보고했다.
⚡ 오늘 바로 활용
장기 실행 에이전트를 구축할 때는 작업 상태를 실행 컨텍스트와 분리하고, 계속 진행하기 전에 상태 변경을 환경과 대조해 검증해야 한다.
출처 및 원본 보도
이 브리핑은 아래 매체의 보도를 요약하고 링크합니다.
이 브리핑이 유용했나요? 다음 소식을 메일로 받아보세요.
관련: 연구
연구
감사-수정 맥락이 LLM 검증기를 더 관대하게 만든다는 연구 결과
arXiv 논문은 모델 맥락에 앞선 감사-수정 사례가 있을 때 오탐이 줄어든다고 보고했다.
arXiv cs.AI+1 outlet·19h ago
연구
AlphaEvolve, 행렬 곱셈 상한 낮추는 데 기여
새 arXiv 노트가 행렬 곱셈 지수의 개선된 상한을 보고했다.
arXiv cs.AI+1 outlet·19h ago
연구
InternLM, Mobius 모델 아키텍처 제안
arXiv 논문은 압축률과 추론 효율을 높이기 위해 메모리와 추론을 분리했다.
r/LocalLLaMA+1 outlet·1d ago