AI4AI-Bench 测试智能体的训练算法设计能力
这项 arXiv 基准评估 LLM 智能体能否在冻结的代码仓库中改写训练算法。
为什么重要
这项工作瞄准了智能体评测中的一个缺口:将训练运行方式的改变,与模型学习方式的改变区分开来。它也凸显了一个尚未解决的术语问题:如果没有权重层面的能力提升,持续性的研究状态改进是否应被称为递归式自我改进。
核心要点
- 1.该基准覆盖 10 个冻结代码仓库和训练算法家族。
- 2.智能体有 4 小时改写算法,随后接受隐藏评估。
- 3.这一设置并未证明模型在权重层面实现自我改进。
一篇新的 arXiv 论文提出了 AI4AI-Bench,这是一个用于测试 LLM 智能体能否设计出更优训练算法的基准;作者认为,这种能力是递归式自我改进的核心。该基准覆盖 10 个冻结的研究代码仓库,横跨 10 类训练算法;在每项任务中,智能体会获得 4 小时和一块 B300,用来改写训练算法,随后其代码会从零开始重新运行最多 12 小时,并由隐藏的固定评估器与原始算法对比打分。一场 Reddit 讨论指出,这一设置采用的是范围更窄的递归式自我改进定义,因为底层模型和评估器保持不变,而不是模型改变自身权重。
⚡ 今天就能用
在把 AI4AI-Bench 的结果作为权重层面递归式自我改进的证据之前,应先阅读其论文。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
- arXiv cs.LGAI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-ImprovementAug 21, 12:00 PM↗
- arXiv cs.CLAI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-ImprovementAug 21, 12:00 PM↗
- r/LocalLLaMAIf the weights never change, is it really recursive self-improvement?Aug 18, 10:10 PM↗
觉得这篇简报有用?下一篇直接送到你的邮箱。