AAI News Hub
RechercheTue, August 18, 2026·2d ago2 sources corroborating

L’étude Abra cartographie les lois de passage à l’échelle pour l’entraînement d’images par diffusion

HF Daily Papers met en avant une étude sur le passage à l’échelle du calcul pour les modèles de diffusion texte-image.

Pourquoi c'est important

Ces travaux offrent des repères pratiques pour le passage à l’échelle de la génération visuelle, un domaine où les règles d’entraînement optimales en calcul sont moins établies que dans la modélisation du langage. Leurs conclusions suggèrent que le volume de données peut compter davantage que la taille du modèle lorsqu’on alloue le calcul aux systèmes de diffusion d’images.

Points clés

  • 1.Abra étudie le passage à l’échelle de la diffusion de 10^19 à 10^22 FLOPs.
  • 2.L’optimalité de calcul se situe autour de 200 tokens image par paramètre.
  • 3.Les modèles de diffusion semblent résister au surentraînement.

Des chercheurs ont présenté Abra, une famille contrôlée de transformers à appariement de flux utilisée pour étudier le passage à l’échelle de la diffusion texte-image sur des budgets de calcul allant de 10^19 à 10^22 FLOPs. L’étude indique que les modèles de diffusion évoluent de façon prévisible, comme les modèles de langage, mais atteignent l’optimalité de calcul à environ 200 tokens image par paramètre, soit près de dix fois la prescription Chinchilla pour les LLM. Elle montre aussi que les modèles de diffusion résistent bien au surentraînement et que cette prévisibilité va au-delà de la perte d’entraînement, jusqu’aux métriques de qualité, aux réglages CFG, à la qualité des représentations et à la forme des courbes d’entraînement.

À tester aujourd'hui

Pour entraîner des modèles de diffusion d’images, privilégiez davantage de données d’entraînement avant d’augmenter la taille du modèle.

Sources et articles originaux

Ce brief résume et renvoie vers la couverture des médias ci-dessous.

Ce brief vous a plu ? Recevez le prochain par e-mail.

Plus dans Recherche