AAI News Hub
InvestigaciónTue, August 18, 2026·2d ago2 sources corroborating

Un estudio de Abra traza las leyes de escalado en el entrenamiento de imágenes por difusión

HF Daily Papers destaca un estudio sobre escalado computacional en modelos de difusión de texto a imagen.

Por qué importa

El trabajo ofrece orientación práctica de escalado para la generación visual, un ámbito en el que las reglas de entrenamiento óptimas en cómputo están menos consolidadas que en el modelado de lenguaje. Sus hallazgos sugieren que el volumen de datos puede importar más que el tamaño del modelo al asignar cómputo para sistemas de imágenes por difusión.

Puntos clave

  • 1.Abra estudia el escalado de difusión de 10^19 a 10^22 FLOPs.
  • 2.La optimalidad computacional se alcanza cerca de 200 tokens de imagen por parámetro.
  • 3.Los modelos de difusión parecen robustos al sobreentrenamiento.

Investigadores presentaron Abra, una familia controlada de transformers de flow matching usada para estudiar el escalado de difusión de texto a imagen con presupuestos de cómputo de 10^19 a 10^22 FLOPs. El estudio señala que los modelos de difusión escalan de forma predecible, como los modelos de lenguaje, pero alcanzan la optimalidad computacional en torno a 200 tokens de imagen por parámetro, aproximadamente diez veces la prescripción de Chinchilla para los LLMs. También concluye que los modelos de difusión son robustos al sobreentrenamiento y que la predictibilidad va más allá de la pérdida de entrenamiento, abarcando métricas de calidad, configuraciones de CFG, calidad de representación y la forma de la curva de entrenamiento.

Pruébalo hoy

Al entrenar modelos de imágenes por difusión, prioriza más datos de entrenamiento antes de aumentar el tamaño del modelo.

Fuentes y cobertura original

Este resumen sintetiza y enlaza la cobertura de los medios siguientes.

¿Te gustó este resumen? Recibe el próximo en tu correo.

Más en Investigación