Les tokenizers KVAE ciblent la génération audio, image et vidéo
Le rapport publié sur arXiv décrit des tokenizers pour des modèles de diffusion latente multimodaux conditionnés par du texte.
Pourquoi c'est important
Les tokenizers sont une dépendance centrale des systèmes de diffusion latente : ils influencent la vitesse d’entraînement, la qualité des sorties et les workflows de génération en aval. Une famille commune de tokenizers couvrant plusieurs modalités pourrait aider les chercheurs à comparer et à construire de manière plus cohérente des modèles audio, image et vidéo conditionnés par du texte.
Points clés
- 1.KVAE couvre la tokenisation audio, image et vidéo.
- 2.Les modèles sont conçus pour la génération conditionnée par du texte.
- 3.Les auteurs rapportent des résultats compétitifs face à des tokenizers open source de pointe.
Un nouveau rapport publié sur arXiv présente KVAE, une famille de tokenizers destinés aux modèles génératifs multimodaux couvrant l’audio, l’image et la vidéo. L’ensemble comprend KVAE-Audio, un tokenizer continu pleine bande à 48 kHz avec un latent à 50 Hz de 64 canaux ; KVAE-3D, deux tokenizers vidéo causaux avec une compression de 4x16x16 et 4x8x8 ; et KVAE-2D, un tokenizer d’image avec une compression 8x et 32 canaux. Les auteurs font état de résultats en reconstruction et en génération qui égalent ou dépassent plusieurs tokenizers open source de pointe, selon des métriques objectives et subjectives.
⚡ À tester aujourd'hui
Lisez l’article et comparez les métriques de reconstruction et de génération rapportées pour KVAE avant de choisir des tokenizers pour des travaux de diffusion multimodale.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
Des chercheurs proposent un modèle de diffusion pour supprimer les reflets dans les vidéos
S2R associe une simulation physique des reflets à un modèle de suppression vidéo par diffusion et à un benchmark.
Un article estime que la sécurité des agents exige des contrats d’exécution
L’article publié sur arXiv affirme que l’alignement au moment de l’entraînement ne suffit pas pour les agents autonomes.
Des chercheurs testent des dispositifs conçus par l’IA pour aider des modèles plus faibles
Un modèle plus puissant a construit, au moment de l’inférence, des échafaudages qui ont amélioré les scores de modèles plus faibles sur des benchmarks de théorie de l’esprit.