연구진, LLM 에이전트용 HarnessOpt-Bench 공개
이 벤치마크는 고정된 평가 예산 안에서 LLM이 에이전트 하네스를 얼마나 잘 개선할 수 있는지 테스트한다.
왜 중요한가
이번 연구는 평가의 초점을 모델 가중치 자체에서 에이전트 성능을 좌우하는 프롬프트, 도구, 제어 흐름, 메모리, 오케스트레이션 코드로 넓힌다. 또한 현실적인 평가 제약 아래에서 frontier LLM이 하네스 변경을 통해 에이전트 시스템을 개선할 수 있는지 측정하는 공통 프로토콜을 제공한다.
핵심 포인트
- 1.HarnessOpt-Bench는 LLM 에이전트의 엔드투엔드 하네스 최적화를 평가한다.
- 2.채점은 보류 테스트에서 초기 하네스 대비 정규화된 향상 폭을 기준으로 한다.
- 3.이 벤치마크에는 감사와 리소스 계량을 위한 실행 제어 기능이 포함된다.
연구진이 LLM 기반 에이전트 시스템의 자동 하네스 최적화를 평가하기 위한 벤치마크인 HarnessOpt-Bench를 공개했다. 이 설정에서 LLM 최적화기는 대상 에이전트의 초기 하네스, 채점된 평가 피드백, 고정된 평가 예산을 받은 뒤 하네스를 수정하고 최종 후보를 제출한다. 후보는 별도 보류 테스트 파티션에서 초기 하네스 대비 정규화된 향상 폭으로 채점되며, 신뢰 실행 환경이 평가 경계를 강제하고 리소스 사용량을 계량하며 감사용 버전을 보존한다.
⚡ 오늘 바로 활용
자동 프롬프트, 도구 또는 에이전트 오케스트레이션 최적화를 실험할 때는 보류 테스트와 리소스 계량을 활용하라.
출처 및 원본 보도
이 브리핑은 아래 매체의 보도를 요약하고 링크합니다.
- arXiv cs.AIHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 7, 12:00 PM↗
- arXiv cs.LGHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 7, 12:00 PM↗
- arXiv cs.CLHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 7, 12:00 PM↗
- arXiv cs.LGEvolveNet: Collaborative Harness Evolution for Agent Self-ImprovementAug 6, 12:00 PM↗
- HF Daily PapersHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 6, 4:00 AM↗
- arXiv cs.AIWeClawArena: An Auditable Sandbox and Benchmark for Cross-User Agents Collaboration and Security in Human-Centered Agent NetworksAug 5, 12:00 PM↗
이 브리핑이 유용했나요? 다음 소식을 메일로 받아보세요.
관련: 연구
연구
Anthropic 연구, AI 에이전트가 공동 작업에서 충돌할 수 있다고 밝혀
연구진은 다중 에이전트 행동이 현재 AI 안전성 테스트의 허점을 드러낼 수 있다고 말한다.
TechCrunch AI·1h ago
연구
연구진, 동영상 반사 제거를 위한 확산 모델 제안
S2R은 물리 기반 반사 시뮬레이션과 확산형 동영상 제거 모델 및 벤치마크를 결합했다.
arXiv cs.AI+1 outlet·16h ago
연구
논문, 에이전트 안전에는 런타임 계약이 필요하다고 주장
arXiv 논문은 자율 에이전트에 훈련 시점의 정렬만으로는 충분하지 않다고 말한다.
arXiv cs.AI+1 outlet·16h ago