WorldCycle entraîne des modèles vidéo du monde avec un RL auto-vérifiant
Le framework utilise des cycles d’actions réversibles pour vérifier la cohérence à long horizon sans annotations.
Pourquoi c'est important
Les modèles vidéo du monde à long horizon sont importants pour la planification et l’exploration, mais leur vérification est difficile lorsqu’il n’existe pas d’état futur de référence. WorldCycle propose de générer des signaux d’entraînement à partir de la réversibilité plutôt qu’à partir d’étiquettes manuelles ou de simulateurs externes.
Points clés
- 1.WorldCycle utilise des cycles d’actions réversibles comme supervision auto-vérifiante.
- 2.Les récompenses ciblent la clôture spatiale et la cohérence temporelle sur des cycles répétés.
- 3.L’approche s’attaque à la dérive dans les modèles vidéo interactifs du monde à long horizon.
Des chercheurs ont présenté WorldCycle, un framework d’apprentissage par renforcement pour les modèles vidéo interactifs du monde, conçu pour réduire l’accumulation d’erreurs dans les prédictions à long horizon. La méthode construit des cycles d’actions fermés à partir de séquences d’actions ordinaires et exploite le fait qu’une séquence suivie de son inverse devrait ramener le système à son état initial, comme signal de supervision sans annotation. Elle optimise des récompenses de clôture spatiale et de cohérence temporelle afin que les actions se comportent comme des opérateurs d’état cohérents, y compris sur des cycles d’actions composites hors distribution.
⚡ À tester aujourd'hui
Lisez l’article avant de concevoir un post-entraînement par RL pour des modèles vidéo du monde nécessitant des contrôles de cohérence à long horizon.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
- arXiv cs.AIWorldCycle: Self-Verifiable Reinforcement Learning for Long-Horizon Video World ModelsAug 6, 12:00 PM↗
- arXiv cs.LGWorldCycle: Self-Verifiable Reinforcement Learning for Long-Horizon Video World ModelsAug 6, 12:00 PM↗
- HF Daily PapersWorldCycle: Self-Verifiable Reinforcement Learning for Long-Horizon Video World ModelsAug 5, 4:00 AM↗
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
L’équipe MiLMMT publie des modèles de traduction sans référence
MiLMMT-46-v1.0 utilise GRPO et l’interpolation de checkpoints pour améliorer la traduction multilingue ouverte.
DistilVDR compresse la recherche visuelle de documents
Ce moteur de recherche à 524 millions de paramètres utilise une distillation bilatérale à partir d’un modèle enseignant vision-langage de 8 milliards de paramètres.
Des chercheurs proposent Power Law Graph Attention
PLGA généralise l’attention par produit scalaire mis à l’échelle et rapporte un effondrement de l’inférence sous invariance exacte.