ByteDance entrena un modelo de IA que podría alcanzar los 10 billones de parámetros
El modelo, aún en una fase inicial, sería mucho más grande que Kimi K3 de Moonshot, según Ars Technica.
Por qué importa
El esfuerzo reportado sugiere que las empresas chinas de IA siguen apostando por modelos frontera de gran escala mientras intentan cerrar la brecha con los principales laboratorios de Estados Unidos. Si se lanza, el modelo superaría el tamaño de Kimi K3 de Moonshot, descrito como el mayor modelo chino publicado hasta la fecha.
Puntos clave
- 1.ByteDance estaría preentrenando un modelo de IA de gran tamaño.
- 2.El modelo podría alcanzar hasta 10 billones de parámetros.
- 3.El tamaño exacto y el calendario de lanzamiento siguen sin definirse.
ByteDance está entrenando un modelo de IA que podría acercarse al tamaño de Mythos, el sistema más avanzado de Anthropic, informó Ars Technica, citando a tres personas familiarizadas con el asunto. El modelo se encuentra en una etapa temprana de preentrenamiento y podría tener hasta 10 billones de parámetros, aunque su tamaño exacto se determinará más adelante. Una fuente dijo que el preentrenamiento suele tomar entre tres y seis meses antes del ajuste fino y el lanzamiento, si el desarrollo avanza con éxito.
⚡ Pruébalo hoy
Conviene seguir los detalles del eventual lanzamiento de ByteDance antes de tomar decisiones sobre proveedores o arquitectura basadas en afirmaciones sobre el tamaño del modelo.
Fuentes y cobertura original
Este resumen sintetiza y enlaza la cobertura de los medios siguientes.
¿Te gustó este resumen? Recibe el próximo en tu correo.
Más en Modelos
Google DeepMind presenta un modelo de lengua de señas a texto
SL2T de DeepMind impulsa nuevas funciones de lengua de señas para personas sordas y con dificultades auditivas.
LiquidAI lanza LFM2.5-VL-3B en Hugging Face
El modelo multimodal de la categoría de 3B apunta a tareas de visión en el edge con soporte para texto, imagen, OCR y grounding.
Probadores locales comparan Muse Glimmer 30B con Qwen
Los primeros informes en r/LocalLLaMA muestran resultados dispares en programación, pero un uso eficiente de tokens para Muse Glimmer 30B.