研究人员推出用于自主科学研究的 ASI-Bench
该基准通过 60 项研究任务,测试创新探索能力和科学执行能力。
为什么重要
ASI-Bench 瞄准了当前 AI 评估中的一个缺口:系统是否能够生成新知识并产出可验证结果,而不只是基于已学知识回答问题。它可能影响研究人员评估更自主的科学 AI 系统进展的方式。
核心要点
- 1.测试 11 个领域中的自主科学执行能力。
- 2.包含 60 项项目级研究任务。
- 3.逐步移除方法论指导。
研究人员推出了 ASI-Bench,这一基准旨在评估 AI 系统在通用研究领域中的创新探索和自主科学执行能力。该基准涵盖 11 个科学领域的 60 项项目级研究任务,并逐步减少方法论指导,以测试 AI 系统能够在多大程度上独立推进。该项目由 40 多位专家打造,投入超过 31,000 个人工小时,相关任务还经过专家评审和 AI 辅助审计。
⚡ 今天就能用
在用基准分数支撑有关自主科学发现的说法之前,先阅读 ASI-Bench 论文。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
觉得这篇简报有用?下一篇直接送到你的邮箱。