AAI News Hub
ForschungWed, August 5, 2026·Aug 52 sources corroborating

NOLLI-Benchmark untersucht Leistungsunterschiede von KI bei Englisch und Koreanisch

Die Rätselsuite prüft, ob Unterschiede aus der Sprache, der Schriftverarbeitung oder koreanisch-spezifischen Aufgaben entstehen.

Warum es wichtig ist

Die Ergebnisse deuten darauf hin, dass schwächere Leistungen im Koreanischen weniger von der Präsentationssprache allein abhängen könnten als von schrift- und orthografiespezifischen Fähigkeiten. Das gibt Modellentwicklern eine gezieltere Möglichkeit, mehrsprachige Schwächen zu diagnostizieren.

Die Kernpunkte

  • 1.NOLLI umfasst 7.500 deterministische englisch-koreanische Rätselaufgaben.
  • 2.Die Genauigkeit bei abgestimmten englisch-koreanischen Aufgaben war für qualifizierende Modelle statistisch gleichwertig.
  • 3.Aufgaben mit starkem Hangul-Jamo-Anteil legten größere Leistungsunterschiede zwischen Modellen offen.

Forscher haben NOLLI vorgestellt, einen prozedural generierten englisch-koreanischen Rätselbenchmark mit 15 Rätseltypen, 25 Aufgaben und 7.500 Einträgen. Der Benchmark nutzt per Seed reproduzierbare Instanzen mit eindeutigen Lösungen und deterministischer Bewertung und evaluiert abgestimmte Übersetzungen, Anpassungen an die Hangul-Jamo-Schrift sowie ausschließlich koreanische Aufgaben. In Tests mit 15 Frontier-, Open-Weight- und in Korea entwickelten Modellen war die Genauigkeit bei abgestimmten englisch-koreanischen Aufgaben unter 12 Modellen oberhalb einer Gesamttrefferschwelle von 3 % statistisch gleichwertig, während schreibsystemintensive Aufgaben deutlichere Unterschiede zeigten.

Heute ausprobieren

Nutzen Sie NOLLI-ähnliche schriftspezifische Tests, bevor Sie schließen, dass ein Modell ein breites Defizit in der koreanischen Sprache hat.

Quellen & Originalberichte

Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.

Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.

Mehr in Forschung