HarnessOpt-Bench, LLM의 하니스 최적화 능력을 시험하다
이 벤치마크는 LLM이 에이전트 프롬프트, 도구, 제어 흐름, 오케스트레이션 코드를 얼마나 잘 개선하는지 평가한다.
왜 중요한가
이번 연구는 모델 가중치만이 아니라 프롬프트, 도구, 메모리, 오케스트레이션 코드에서 비롯되는 에이전트 성능 향상에 관심이 커지고 있음을 보여준다. 공통 벤치마크는 frontier LLM과 에이전트 시스템 전반에서 하니스 최적화 관련 주장을 더 비교 가능하게 만들 수 있다.
핵심 포인트
- 1.HarnessOpt-Bench는 엔드투엔드 에이전트 하니스 최적화를 겨냥한다.
- 2.점수는 비공개 테스트에서 초기 하니스 대비 정규화된 향상폭을 기준으로 한다.
- 3.신뢰 실행 환경은 리소스 사용량을 계량하고 감사 추적을 보존한다.
연구진은 에이전트형 시스템 주변의 하니스를 LLM이 얼마나 잘 최적화할 수 있는지 측정하는 벤치마크 HarnessOpt-Bench를 공개했다. 이 프로토콜에서 LLM 최적화기는 초기 하니스, 채점된 평가 피드백, 고정된 평가 예산을 받아 하니스를 수정한 뒤, 비공개 테스트 파티션에서 초기 하니스 대비 정규화된 향상폭으로 점수가 매겨지는 최종 후보를 제출한다. 이 벤치마크는 신뢰 실행 환경을 사용해 평가 경계를 강제하고, 대상 에이전트의 리소스 사용량을 계량하며, 감사용 후보 버전을 보존한다.
⚡ 오늘 바로 활용
LLM이 에이전트 하니스를 최적화하도록 할 때는 비공개 테스트와 엄격한 평가 경계를 사용해야 한다.
출처 및 원본 보도
이 브리핑은 아래 매체의 보도를 요약하고 링크합니다.
- arXiv cs.AIHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 7, 12:00 PM↗
- arXiv cs.LGHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 7, 12:00 PM↗
- arXiv cs.CLHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 7, 12:00 PM↗
- arXiv cs.LGEvolveNet: Collaborative Harness Evolution for Agent Self-ImprovementAug 6, 12:00 PM↗
- HF Daily PapersHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 6, 4:00 AM↗
이 브리핑이 유용했나요? 다음 소식을 메일로 받아보세요.
관련: 연구
연구진, 동영상 반사 제거를 위한 확산 모델 제안
S2R은 물리 기반 반사 시뮬레이션과 확산형 동영상 제거 모델 및 벤치마크를 결합했다.
논문, 에이전트 안전에는 런타임 계약이 필요하다고 주장
arXiv 논문은 자율 에이전트에 훈련 시점의 정렬만으로는 충분하지 않다고 말한다.
연구진, 더 약한 모델을 위한 AI 제작 하네스 테스트
더 강한 모델이 추론 시점의 스캐폴드를 만들어 Theory-of-Mind 벤치마크에서 약한 모델의 점수를 끌어올렸다.