AAI News Hub
연구Tue, August 4, 2026·Aug 42 sources corroborating

OneDayAgent, 장기 자율 에이전트 워크플로를 시험하다

이 하네스는 104개 벤치마크 과제 전반에서 작업 분해, 메모리, 검증을 관리한다.

왜 중요한가

이번 연구는 목표 이탈, 상태 손실, 컨텍스트 초과 등 에이전트 시스템의 고질적인 실패 양상을 겨냥한다. 세 개 모델 계열의 다섯 가지 백엔드 LLM에서 보고된 성능은 하네스 설계가 특정 단일 모델에 의존하지 않고 장기 작업 신뢰성을 높일 수 있음을 시사한다.

핵심 포인트

  • 1.OneDayAgent는 작업 분해, 메모리, 최종 검증을 관리한다.
  • 2.GLM-5.2를 사용해 104개 AgentIF-OneDay 과제에서 0.821점을 기록했다.
  • 3.이 하네스는 세 개 모델 계열의 다섯 가지 LLM 백엔드에서 실행됐다.

연구진은 업무, 학습, 생활 전반의 개방형 일상 요청을 처리하는 자율 에이전트용 하네스 OneDayAgent를 공개했다. 이 시스템은 요청을 범위가 정해진 하위 작업으로 나누고, 컨텍스트 압박 속에서도 실행 메모리를 유지하며, 최종 산출물을 검증하고 수정한다. AgentIF-OneDay에서는 104개 과제를 대상으로 평가됐고, GLM-5.2 백엔드를 사용해 종합 점수 0.821을 기록했다.

오늘 바로 활용

여러 단계를 거치며 목표, 메모리, 산출물 품질을 유지해야 하는 장기 에이전트를 설계하기 전에 이 논문을 읽어볼 필요가 있다.

출처 및 원본 보도

이 브리핑은 아래 매체의 보도를 요약하고 링크합니다.

이 브리핑이 유용했나요? 다음 소식을 메일로 받아보세요.

관련: 연구