AAI News Hub
도구Thu, August 6, 2026·6d ago3 sources corroborating

Prime Agent 공개, 코딩 에이전트 평가는 더 긴 과제로 이동

Prime Intellect가 오픈소스 에이전트를 공개한 가운데, LoopsBench는 장기 코딩 평가를 겨냥했다.

왜 중요한가

이 보고들은 단발성 코딩 벤치마크에서 지속적인 에이전트 실행을 평가하는 방향으로 초점이 이동하고 있음을 보여준다. 오픈 하니스와 장기 벤치마크는 최종 결과만이 아니라 그 이상의 코딩 에이전트 성능을 더 쉽게 들여다볼 수 있게 할 수 있다.

핵심 포인트

  • 1.Prime Agent는 오픈 라이선스를 갖춘 오픈소스로 설명된다.
  • 2.LoopsBench는 112개 과제에 걸쳐 장기 코딩 작업을 테스트한다.
  • 3.보고된 LoopsBench 최고 구성은 과제의 25.00%를 해결했다.

Prime Intellect가 장시간 자율 작업을 위한 오픈소스 코딩 및 리서치 에이전트 Prime Agent를 공개했다고, GitHub와 블로그를 링크한 Reddit 게시물이 전했다. 해당 게시물은 Prime Agent가 프로그래밍 방식의 도구 호출, 변수로서의 컨텍스트, 멀티 에이전트 메시징, 자체 수정 가능한 하니스 상태를 사용한다고 설명하며, ARC-AGI-3 점수 95.5%를 기록했다고 밝혔다. 이와 별도로 arXiv 논문은 8개 프로그래밍 언어와 9개 도메인에 걸친 112개 과제로 구성된 장기 벤치마크 LoopsBench를 소개했다. 평가된 구성 중 가장 강력한 Opus-4.7과 Claude Code, 외부 연속 실행 조합은 과제의 25.00%를 해결했다.

오늘 바로 활용

장시간 개발 작업에 대한 코딩 에이전트 벤치마크 주장을 신뢰하기 전에 Prime Agent의 코드와 LoopsBench를 검토해야 한다.

출처 및 원본 보도

이 브리핑은 아래 매체의 보도를 요약하고 링크합니다.

이 브리핑이 유용했나요? 다음 소식을 메일로 받아보세요.

관련: 도구·오픈소스