AAI News Hub
研究Wed, August 5, 2026·Aug 52 sources corroborating

NOLLIベンチマーク、英韓AI性能の格差を検証

このパズルスイートは、性能差が言語そのものに由来するのか、文字処理なのか、韓国語固有のタスクなのかをテストする。

なぜ重要か

結果は、韓国語での性能低下が、提示言語そのものよりも、文字体系や正書法に特有の能力に左右される可能性を示している。モデル開発者にとって、多言語対応の弱点をより的確に診断する手がかりとなる。

要点

  • 1.NOLLIは、決定論的に採点される英韓パズル項目7,500件を含む。
  • 2.条件を満たしたモデルでは、対応する英韓の正答率は統計的に同等だった。
  • 3.ハングルのjamo処理を多く含むタスクでは、モデル間の性能差がより大きく表れた。

研究者らは、手続き的に生成される英韓パズルベンチマーク「NOLLI」を発表した。15種類のパズル、25のタスク、7,500項目で構成される。このベンチマークは、シードから再生成可能で一意の解を持つ問題、決定論的な採点を採用し、対応する翻訳、ハングルの字母(jamo)に基づく文字体系適応、韓国語のみのタスクを評価する。フロンティアモデル、オープンウェイトモデル、韓国で開発されたモデルを含む15モデルのテストでは、全体正答率3%を超えた12モデルについて、対応する英韓の正答率は統計的に同等だった一方、文字体系の処理が重要なタスクではより大きな差が表れた。

今日から使える

モデルに広範な韓国語能力の不足があると結論づける前に、NOLLIのような文字体系固有のテストを使うべきだ。

出典・一次報道

本記事は以下の媒体の報道を要約し、リンクしています。

この記事が役に立ちましたか?次号をメールでお届けします。

関連: 研究