ByteDance entraîne un modèle d’IA qui pourrait atteindre 10 000 milliards de paramètres
Ce modèle encore à un stade précoce serait bien plus massif que Kimi K3 de Moonshot, selon Ars Technica.
Pourquoi c'est important
Cette initiative signalée laisse penser que les entreprises chinoises d’IA continuent de miser sur de très grands modèles de pointe pour tenter de réduire l’écart avec les principaux laboratoires américains. S’il est publié, le modèle dépasserait la taille de Kimi K3 de Moonshot, présenté comme le plus grand modèle chinois publié à ce jour.
Points clés
- 1.ByteDance serait en train de pré-entraîner un très grand modèle d’IA.
- 2.Le modèle pourrait atteindre jusqu’à 10 000 milliards de paramètres.
- 3.Sa taille exacte et son calendrier de sortie restent indéterminés.
ByteDance entraîne un modèle d’IA qui pourrait approcher la taille du système Mythos le plus avancé d’Anthropic, a rapporté Ars Technica, citant trois personnes proches du dossier. Le modèle en est au début de sa phase de pré-entraînement et pourrait compter jusqu’à 10 000 milliards de paramètres, même si sa taille exacte sera fixée plus tard. Une source a indiqué que le pré-entraînement prend généralement de trois à six mois avant l’affinage et la sortie, si le développement se déroule avec succès.
⚡ À tester aujourd'hui
Suivez les détails de la sortie éventuelle de ByteDance avant de prendre des décisions de fournisseur ou d’architecture fondées sur des affirmations concernant la taille du modèle.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Modèles
Google DeepMind présente un modèle de transcription de la langue des signes en texte
Le modèle SL2T de DeepMind alimente de nouvelles fonctionnalités en langue des signes pour les personnes sourdes et malentendantes.
LiquidAI publie LFM2.5-VL-3B sur Hugging Face
Ce modèle multimodal de la classe 3B vise les tâches de vision en périphérie, avec prise en charge du texte, des images, de l’OCR et du grounding.
Des testeurs locaux évaluent Muse Glimmer 30B face à Qwen
Les premiers retours sur r/LocalLLaMA font état de résultats mitigés en code, mais d’une utilisation efficace des tokens pour Muse Glimmer 30B.