AAI News Hub
연구Tue, August 18, 2026·2d ago2 sources corroborating

연구진, 자율 과학 연구 평가를 위한 ASI-Bench 공개

이 벤치마크는 60개 연구 과제를 통해 혁신적 탐구와 과학적 실행 능력을 평가한다.

왜 중요한가

ASI-Bench는 현재 AI 평가의 공백을 겨냥한다. 학습한 지식에서 답을 내놓는 것을 넘어, 시스템이 새로운 지식을 생성하고 검증 가능한 결과를 만들어낼 수 있는지를 묻는 것이다. 이는 연구자들이 더 자율적인 과학 AI 시스템을 향한 진전을 평가하는 방식에 영향을 줄 수 있다.

핵심 포인트

  • 1.11개 분야에서 자율적 과학 실행 능력을 평가한다.
  • 2.60개의 프로젝트 수준 연구 과제를 포함한다.
  • 3.방법론적 지침을 단계적으로 제거한다.

연구진은 일반 연구 분야 전반에서 AI 시스템의 혁신적 탐구와 자율적인 과학적 실행 능력을 평가하기 위한 벤치마크인 ASI-Bench를 공개했다. 이 벤치마크는 11개 과학 분야에 걸친 60개의 프로젝트 수준 연구 과제로 구성됐으며, 방법론적 지침을 단계적으로 줄여 AI 시스템이 독립적으로 어디까지 나아갈 수 있는지 시험한다. 이 프로젝트는 40명 이상의 전문가가 31,000시간이 넘는 인력을 투입해 구축했으며, 과제는 전문가 검토와 AI 보조 감사를 거친다.

오늘 바로 활용

자율적 과학 발견에 대한 주장을 뒷받침하는 데 벤치마크 점수를 사용하기 전에 ASI-Bench 논문을 먼저 읽어야 한다.

출처 및 원본 보도

이 브리핑은 아래 매체의 보도를 요약하고 링크합니다.

이 브리핑이 유용했나요? 다음 소식을 메일로 받아보세요.

관련: 연구