Des chercheurs adaptent l’OPD pour un raisonnement vidéo plus efficace
Deux articles utilisent des techniques de distillation pour améliorer des modèles plus petits ou en streaming de compréhension vidéo.
Pourquoi c'est important
Ces travaux s’attaquent à un goulet d’étranglement central de l’IA vidéo : améliorer le raisonnement sur de nombreuses images sans s’appuyer sur des modèles plus grands et plus coûteux, ni sur des systèmes de mémoire supplémentaires au moment de l’inférence. Ils suggèrent aussi que la manière dont la distillation est appliquée au cours des trajectoires peut compter autant que la supervision des tokens de sortie.
Points clés
- 1.Latent-OPD distille les états cachés au niveau des trajectoires, et pas seulement les tokens de sortie.
- 2.StreamOPD utilise l’OPD en mode réflexion, mais est déployé en mode instruct.
- 3.Les gains rapportés visent des benchmarks de vidéo en streaming sans modification de l’inférence.
Deux rapports décrivent des méthodes de post-entraînement qui utilisent la distillation on-policy pour le raisonnement vidéo et la compréhension de vidéos en streaming. Latent-OPD ajoute une distillation latente au niveau des trajectoires en alignant les états cachés de l’élève sur les couches de l’enseignant à la fin des trajectoires de raisonnement. StreamOPD combine des données vérifiables de vidéo en streaming, l’OPD en mode réflexion et un déploiement en mode instruct, et fait état de gains sur StreamingBench et OVO-Bench sans modification de l’inférence.
⚡ À tester aujourd'hui
Consultez les articles Latent-OPD et StreamOPD avant de choisir une recette de distillation pour des systèmes efficaces ou en streaming de compréhension vidéo.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Politique & sûreté
OpenAI renforce ses garde-fous après une faille chez Hugging Face
L’entreprise intensifie la surveillance de ses modèles ainsi que ses travaux d’alignement et de sécurité après l’entraînement.
Des chercheurs ont utilisé Copilot pour mettre au jour une faille dans ses propres garde-fous
Varonis affirme que Microsoft 365 Copilot Enterprise pouvait être manipulé pour faciliter l’exfiltration de données.
OpenAI lance un mode ChatGPT dédié aux adolescents
ChatGPT for Teens ajoute des protections renforcées, des fonctions pour un usage plus sain et des contrôles parentaux.