AURORA-LM vise la génération de texte en latents continus
L’article propose un modèle de langage par diffusion fondé sur des latents textuels continus et décodables.
Pourquoi c'est important
Ces travaux explorent la possibilité pour les modèles de langage de dépasser les tokens discrets au profit d’espaces latents continus, plus proches des techniques utilisées pour la génération d’images, de vidéos et d’audio. Si elles se révèlent efficaces, de telles architectures pourraient orienter les futures recherches sur la génération de texte par diffusion et la fidélité au niveau des tokens.
Points clés
- 1.AURORA-LM modélise le texte dans un espace latent continu.
- 2.L’architecture préserve un latent textuel décodable à grande capacité.
- 3.La génération s’effectue bloc par bloc, avec un débruitage parallèle à l’intérieur des blocs.
Un nouvel article publié sur arXiv présente AURORA-LM, un modèle de langage par diffusion à latents continus destiné à la génération de texte. L’approche sépare la construction d’une représentation textuelle décodable de la modélisation de sa distribution, en s’appuyant sur un encodeur-décodeur à requêtes et un Diffusion Transformer causal par blocs entraîné par flow matching. Le modèle génère les blocs de gauche à droite tout en débruitant en parallèle les positions à l’intérieur de chaque bloc.
⚡ À tester aujourd'hui
Lisez l’article avant d’utiliser des approches de diffusion à latents continus dans des expériences de génération de texte.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
Des chercheurs proposent un modèle de diffusion pour supprimer les reflets dans les vidéos
S2R associe une simulation physique des reflets à un modèle de suppression vidéo par diffusion et à un benchmark.
Un article estime que la sécurité des agents exige des contrats d’exécution
L’article publié sur arXiv affirme que l’alignement au moment de l’entraînement ne suffit pas pour les agents autonomes.
Des chercheurs testent des dispositifs conçus par l’IA pour aider des modèles plus faibles
Un modèle plus puissant a construit, au moment de l’inférence, des échafaudages qui ont amélioré les scores de modèles plus faibles sur des benchmarks de théorie de l’esprit.