AAI News Hub
研究Tue, August 18, 2026·2d ago2 家媒体交叉佐证

研究人员推出用于自主科学研究的 ASI-Bench

该基准通过 60 项研究任务,测试创新探索能力和科学执行能力。

为什么重要

ASI-Bench 瞄准了当前 AI 评估中的一个缺口:系统是否能够生成新知识并产出可验证结果,而不只是基于已学知识回答问题。它可能影响研究人员评估更自主的科学 AI 系统进展的方式。

核心要点

  • 1.测试 11 个领域中的自主科学执行能力。
  • 2.包含 60 项项目级研究任务。
  • 3.逐步移除方法论指导。

研究人员推出了 ASI-Bench,这一基准旨在评估 AI 系统在通用研究领域中的创新探索和自主科学执行能力。该基准涵盖 11 个科学领域的 60 项项目级研究任务,并逐步减少方法论指导,以测试 AI 系统能够在多大程度上独立推进。该项目由 40 多位专家打造,投入超过 31,000 个人工小时,相关任务还经过专家评审和 AI 辅助审计。

今天就能用

在用基准分数支撑有关自主科学发现的说法之前,先阅读 ASI-Bench 论文。

来源与原始报道

本简报汇总并链接到以下媒体的报道。

觉得这篇简报有用?下一篇直接送到你的邮箱。

更多 研究