JoyAI-Video-Edit apunta a la edición de video en tiempo real
El sistema de difusión autorregresiva de 16.000 millones de parámetros edita video 720p a unos 30 FPS en una sola Nvidia B200.
Por qué importa
El trabajo aborda un cuello de botella clave para la edición interactiva de video: mantener la consistencia temporal con baja latencia y recursos de cómputo limitados. Si es reproducible, podría reducir la brecha de calidad entre los sistemas de edición de video con IA en streaming y offline.
Puntos clave
- 1.El modelo de difusión autorregresiva de 16.000 millones de parámetros admite ediciones en streaming de final abierto.
- 2.El sistema reporta edición 720p a unos 30 FPS en una sola GPU Nvidia B200.
- 3.Las evaluaciones muestran mejoras frente a editores en streaming y competitividad con sistemas offline.
Investigadores presentaron JoyAI-Video-Edit, un marco de difusión autorregresiva de 16.000 millones de parámetros para la edición de video en tiempo real y de final abierto. El sistema usa adaptación autorregresiva por fragmentos, Source-Anchored Distribution Matching Distillation y Long-Horizon Autoregressive Distillation para preservar la fidelidad a la fuente y reducir la deriva temporal sin fotogramas futuros ni una duración de video predefinida. Las evaluaciones automáticas y humanas reportadas muestran que supera a los editores en streaming existentes y sigue siendo competitivo frente a sistemas offline sólidos en videos cortos y largos.
⚡ Pruébalo hoy
Revisa el código y el artículo antes de probar flujos de edición 720p en tiempo real en hardware de clase B200.
Fuentes y cobertura original
Este resumen sintetiza y enlaza la cobertura de los medios siguientes.
¿Te gustó este resumen? Recibe el próximo en tu correo.
Más en Investigación
El equipo de MiLMMT lanza modelos de traducción sin referencias
MiLMMT-46-v1.0 usa GRPO e interpolación de checkpoints para mejorar la traducción multilingüe abierta.
DistilVDR comprime la recuperación de documentos visuales
El recuperador de 524 millones de parámetros usa destilación bilateral a partir de un modelo docente de visión-lenguaje de 8B.
Investigadores proponen Power Law Graph Attention
PLGA generaliza la atención de producto punto escalado y reporta colapso de inferencia bajo invariancia exacta.