AAI News Hub
工具Thu, August 6, 2026·5d ago3 家媒体交叉佐证

随着编码智能体面临更长测试,Prime Agent 发布

Prime Intellect 发布了一款开源智能体;与此同时,LoopsBench 瞄准长周期编码评测。

为什么重要

这些报告显示,编码基准测试正从一次性任务转向评估持续的智能体执行能力。开放运行框架和长周期基准测试,可能让人们更容易在最终结果之外审视编码智能体的表现。

核心要点

  • 1.Prime Agent 被描述为采用开放许可证的开源项目。
  • 2.LoopsBench 测试横跨 112 项任务的长周期编码工作。
  • 3.LoopsBench 报告的最佳配置解决了 25.00% 的任务。

据一篇链接到其 GitHub 和博客的 Reddit 帖文称,Prime Intellect 发布了 Prime Agent,这是一款面向长时间自主工作的开源编码与研究智能体。帖文称,Prime Agent 采用程序化工具调用、将上下文作为变量、多智能体消息传递,以及可自我修改的运行框架状态,并报告其 ARC-AGI-3 得分为 95.5%。另有一篇 arXiv 论文介绍了 LoopsBench,这是一个长周期基准测试,包含横跨八种编程语言和九个领域的 112 项任务;其评测中表现最强的配置为 Opus-4.7 搭配 Claude Code 和外层续跑,解决了 25.00% 的任务。

今天就能用

在依赖编码智能体基准测试声明来判断长时间开发工作能力之前,应先审查 Prime Agent 的代码和 LoopsBench。

来源与原始报道

本简报汇总并链接到以下媒体的报道。

觉得这篇简报有用?下一篇直接送到你的邮箱。

更多 工具与开源