AAI News Hub
研究Tue, August 18, 2026·2d ago2 sources corroborating

研究者ら、自律的な科学研究を評価するASI-Benchを発表

このベンチマークは、60件の研究タスクを通じて、革新的な探索能力と科学的実行力を検証する。

なぜ重要か

ASI-Benchは、現在のAI評価における空白を狙っている。つまり、システムが学習済みの知識から質問に答えるだけでなく、新たな知識を生み出し、検証可能な結果を出せるかどうかだ。自律性の高い科学AIシステムへ向けた進展を研究者がどう評価するかに影響を与える可能性がある。

要点

  • 1.11分野にわたって自律的な科学的実行力を検証する。
  • 2.60件のプロジェクトレベルの研究タスクを含む。
  • 3.方法論上の手引きを段階的に取り除く。

研究者らは、一般的な研究領域における革新的な探索能力と自律的な科学的実行力を評価するためのベンチマーク、ASI-Benchを発表した。ASI-Benchには、11の科学分野にまたがる60件のプロジェクトレベルの研究タスクが含まれ、方法論上の手引きを段階的に減らすことで、AIシステムがどこまで独力で進められるかを試す。プロジェクトは40人超の専門家が31,000時間以上を投じて構築し、タスクは専門家によるレビューとAI支援の監査を経ている。

今日から使える

自律的な科学的発見に関する主張をベンチマークのスコアで裏付ける前に、ASI-Benchの論文を読むべきだ。

出典・一次報道

本記事は以下の媒体の報道を要約し、リンクしています。

この記事が役に立ちましたか?次号をメールでお届けします。

関連: 研究