AAI News Hub
RechercheFri, August 7, 2026·6d ago2 sources corroborating

Des chercheurs publient MameLoshnLM pour le yiddish

Ce modèle open source de 8 milliards de paramètres ajoute un corpus yiddish et un benchmark pour évaluer les langues à faibles ressources.

Pourquoi c'est important

Cette publication montre que les données multilingues bruitées à l’échelle du web peuvent donner de moins bons résultats pour les langues à faibles ressources. Elle fournit aux chercheurs un modèle, un corpus et une suite d’évaluation plus ciblés pour les technologies linguistiques dédiées au yiddish.

Points clés

  • 1.Premier modèle open source de 8 milliards de paramètres conçu spécifiquement pour le yiddish.
  • 2.Oytser combine des sources yiddish issues du web et de la littérature.
  • 3.Kashes teste la traduction, l’analyse, l’extraction et la compréhension.

Des chercheurs ont présenté MameLoshnLM, un modèle de langage open source de 8 milliards de paramètres conçu spécifiquement pour le yiddish à partir d’un préentraînement prolongé de Llama 3.1 8B. Le projet introduit aussi Oytser, un corpus de préentraînement yiddish de haute qualité, ainsi que Kashes, un benchmark multitâche couvrant la traduction, l’analyse linguistique, l’extraction d’informations et la compréhension du langage. Selon l’article, MameLoshnLM surpasse des modèles open source de taille comparable sur l’ensemble du benchmark et saisit mieux les structures lexicales et morphologiques du yiddish que les modèles multilingues généralistes.

À tester aujourd'hui

Utiliser Kashes pour évaluer les modèles compatibles avec le yiddish avant de s’en remettre aux benchmarks multilingues généralistes.

Sources et articles originaux

Ce brief résume et renvoie vers la couverture des médias ci-dessous.

Ce brief vous a plu ? Recevez le prochain par e-mail.

Plus dans Recherche