AAI News Hub
PesquisaTue, August 18, 2026·2d ago2 sources corroborating

Estudo Abra mapeia leis de escala no treinamento de difusão de imagens

O HF Daily Papers destaca um estudo sobre escalonamento computacional para modelos de difusão texto-para-imagem.

Por que importa

O trabalho oferece orientações práticas de escalonamento para geração visual, uma área em que regras de treinamento computacionalmente ótimo são menos consolidadas do que na modelagem de linguagem. Os achados sugerem que o volume de dados pode importar mais do que o tamanho do modelo ao alocar computação para sistemas de difusão de imagens.

Pontos-chave

  • 1.O Abra estuda o escalonamento de difusão de 10^19 a 10^22 FLOPs.
  • 2.A eficiência computacional ideal ocorre perto de 200 tokens de imagem por parâmetro.
  • 3.Modelos de difusão parecem robustos ao treinamento excessivo.

Pesquisadores apresentaram o Abra, uma família controlada de transformers de flow matching usada para estudar o escalonamento da difusão texto-para-imagem em orçamentos computacionais de 10^19 a 10^22 FLOPs. O estudo relata que modelos de difusão escalam de forma previsível, como modelos de linguagem, mas atingem a eficiência computacional ideal em cerca de 200 tokens de imagem por parâmetro, aproximadamente dez vezes a recomendação Chinchilla para LLMs. Também conclui que modelos de difusão são robustos ao treinamento excessivo e que a previsibilidade vai além da perda de treinamento, abrangendo métricas de qualidade, configurações de CFG, qualidade das representações e o formato da curva de treinamento.

Experimente hoje

Ao treinar modelos de difusão de imagens, priorize mais dados de treinamento antes de aumentar o tamanho do modelo.

Fontes e reportagens originais

Este resumo sintetiza e linka a cobertura dos veículos abaixo.

Gostou deste resumo? Receba o próximo no seu e-mail.

Mais em Pesquisa