研究人员提出用于评估 LLM 推理的 Skill Entropy
Skill^2-Bench 测试模型在长程任务中跨技能切换的能力。
为什么重要
这项研究瞄准了长程推理评估中的一个缺口:模型能否在相互依赖的链式任务中可靠地组合不同技能。它表明,即便对当前强大的模型而言,技能切换也是一个可衡量的弱点。
核心要点
- 1.Skill Entropy 衡量推理技能切换的难度。
- 2.Skill^2-Bench 覆盖九个领域的 558 项技能。
- 3.受评模型在高熵任务上的准确率下降。
一篇新论文提出了 Skill Entropy,用于评估多步骤 LLM 任务中不同推理技能切换的难度。作者还提出了 Skill^2-Bench,这是一个覆盖九个可验证与开放式领域、包含 558 项技能的基准,并报告称,八个前沿模型和四个开源模型在高熵任务上的准确率均有所下降。论文还进一步提出 Skill-Entropy RL,将技能熵作为训练信号。
⚡ 今天就能用
可使用 Skill^2-Bench 对需要在相互依赖步骤中组合多种技能的智能体或推理系统进行压力测试。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
- arXiv cs.CLToward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon ReasoningAug 6, 12:00 PM↗
- arXiv cs.LGToward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon ReasoningAug 6, 12:00 PM↗
- HF Daily PapersToward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon ReasoningAug 5, 4:00 AM↗
觉得这篇简报有用?下一篇直接送到你的邮箱。