AAI News Hub
研究Wed, August 5, 2026·Aug 52 家媒体交叉佐证

NOLLI 基准测试探查 AI 英韩表现差距

这套谜题测试用于判断差距究竟来自语言本身、文字系统处理,还是韩语特定任务。

为什么重要

结果表明,模型在韩语上的表现不足,可能并不主要取决于呈现语言本身,而更多与特定文字系统和正字法能力有关。这为模型开发者诊断多语言弱点提供了更有针对性的方法。

核心要点

  • 1.NOLLI 包含 7,500 个确定性的英韩谜题题目。
  • 2.在符合条件的模型中,匹配英韩准确率在统计上相当。
  • 3.大量涉及韩文字母 jamo 的任务暴露出更大的模型性能差距。

研究人员推出了 NOLLI,这是一个程序化生成的英韩谜题基准测试,包含 15 类谜题、25 项任务和 7,500 个题目。该基准采用可通过种子重新生成的题目实例,确保答案唯一并进行确定性评分,同时评估匹配翻译、韩文字母 jamo 的文字系统适配,以及仅限韩语的任务。在对 15 个前沿模型、开放权重模型和韩国研发模型的测试中,在总体准确率高于 3% 门槛的 12 个模型里,匹配英韩准确率在统计上相当;而对书写系统要求更高的任务则显示出更明显的差距。

今天就能用

在断定模型存在广泛韩语能力缺陷之前,应先使用 NOLLI 这类面向特定文字系统的测试。

来源与原始报道

本简报汇总并链接到以下媒体的报道。

觉得这篇简报有用?下一篇直接送到你的邮箱。

更多 研究