FM-Bench, 20년 축구 구단 운영으로 에이전트 평가
이 벤치마크는 서로 연결된 수백 개의 의사결정을 통해 장기 과제에서 LLM 에이전트를 평가한다.
왜 중요한가
이 벤치마크는 시간이 지나며 반응하는 환경에서 누적되는 의사결정이라는 에이전트 평가의 공백을 겨냥한다. 정면 대결 형식은 짧고 제한된 과제를 넘어 에이전트의 행동을 비교하는 데 도움이 될 수 있다.
핵심 포인트
- 1.에이전트는 시뮬레이션상 20년 동안 축구 클럽을 운영한다.
- 2.채점에는 LLM 심판이 아니라 결정론적 엔진이 사용된다.
- 3.Arena는 하나의 공유된 장기 세계에서 모델들을 비교한다.
FM-Bench는 언어 모델 에이전트가 장기간에 걸쳐 의사결정을 지속할 수 있는지 평가하기 위한 새로운 Football Management Benchmark다. 이 벤치마크에서 LLM 에이전트는 약 340~400개의 의사결정 지점에 걸쳐 26개 도구를 사용해 게임 내 시간으로 20년 동안 축구 클럽을 운영하며, 결과는 LLM 심판이나 인간 평가자가 아니라 결정론적 엔진이 채점한다. 공개된 설정에는 15개 프런티어 모델이 스크립트 기반 세계를 상대로 경쟁하는 솔로 트랙과, 모델들과 스크립트 기반 앵커를 하나의 공유된 20년 세계에 배치하는 Arena 트랙이 포함된다.
⚡ 오늘 바로 활용
단기 과제 에이전트 벤치마크를 장기 운영 능력의 근거로 삼기 전에 FM-Bench 논문을 읽어봐야 한다.
출처 및 원본 보도
이 브리핑은 아래 매체의 보도를 요약하고 링크합니다.
이 브리핑이 유용했나요? 다음 소식을 메일로 받아보세요.
관련: 연구
스타트업 “AI 암 치료 진전의 핵심은 데이터”
TechCrunch에 따르면 이 스타트업은 더 나은 데이터 없이는 AI가 암 치료에 가까워지지 못했다고 주장했다.
HarnessRisk, 에이전트 하네스 안전 실패를 벤치마크하다
이 벤치마크는 에이전트 하네스의 단계별 공격을 테스트하며, 관련 연구는 작업별 프로비저닝을 살핀다.
Agent Lightning v1.0, harness 기반 agentic RL 겨냥
이 프레임워크는 임의의 agent harness를 강화학습 기반 post-training에 연결한다.