LG AI Research publie le rapport sur K-EXAONE 2.0
Ce modèle MoE multilingue à poids ouverts compte 750 milliards de paramètres au total et prend en charge des contextes de 256 000 tokens.
Pourquoi c'est important
K-EXAONE 2.0 ajoute au secteur un autre grand modèle multilingue à poids ouverts, avec un accent particulier sur la recherche d’information en contexte long, le codage et la sûreté socioculturelle coréenne. Sa publication sous licence Apache 2.0 offre aux chercheurs et aux développeurs davantage de latitude pour évaluer et adapter des systèmes MoE à l’échelle des modèles de pointe.
Points clés
- 1.Le MoE de 750 milliards de paramètres en active environ 37 milliards par token.
- 2.La prise en charge du contexte atteint 256 000 tokens.
- 3.La licence Apache 2.0 autorise une large évaluation et adaptation.
LG AI Research a publié un rapport technique consacré à K-EXAONE 2.0, un modèle de fondation multilingue à poids ouverts issu d’une évolution de K-EXAONE. Le modèle repose sur une architecture Mixture-of-Experts, avec 750 milliards de paramètres au total et environ 37 milliards activés par token, prend en charge des longueurs de contexte allant jusqu’à 256 000 tokens et étend sa couverture linguistique de six à dix langues. Selon le rapport, K-EXAONE 2.0 améliore les performances de son prédécesseur dans neuf catégories d’évaluation, avec les gains les plus marqués en codage agentique et en compréhension de longs contextes.
⚡ À tester aujourd'hui
Évaluez K-EXAONE 2.0 sur des charges de travail de recherche en contexte long, multilingues et de codage avant d’envisager une utilisation en production.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Modèles
LiquidAI publie LFM2.5-VL-3B sur Hugging Face
Ce modèle multimodal de la classe 3B vise les tâches de vision en périphérie, avec prise en charge du texte, des images, de l’OCR et du grounding.
Des testeurs locaux évaluent Muse Glimmer 30B face à Qwen
Les premiers retours sur r/LocalLLaMA font état de résultats mitigés en code, mais d’une utilisation efficace des tokens pour Muse Glimmer 30B.
OpenAI lance un nouveau modèle d’IA entraîné à la cybersécurité
L’entreprise étend Daybreak, son programme de défense en cybersécurité, avec un nouveau modèle.