AAI News Hub
InvestigaciónTue, August 4, 2026·Aug 42 sources corroborating

Investigadores apuntan a reducir el coste de tokens en LLM de vídeo y omnimodales

Seis nuevos trabajos proponen métodos de poda o compresión de tokens para modelos de vídeo, visuales y audiovisuales.

Por qué importa

Las entradas de vídeo largo y omnimodales pueden encarecer la inferencia porque el número de tokens crece con la cobertura espacial, temporal y de modalidades. Los trabajos apuntan a una dirección de investigación común: preservar la evidencia relevante para la tarea mientras se recortan tokens redundantes antes o durante el procesamiento del LLM.

Puntos clave

  • 1.Los investigadores están abordando el coste de la inferencia multimodal mediante poda, fusión y codebooks de tokens.
  • 2.Varios métodos dan prioridad al contexto global frente a decisiones de saliencia puramente locales.
  • 3.Las tareas con mucho OCR y las audiovisuales pueden requerir presupuestos de tokens adaptados a la tarea o a la modalidad.

Un conjunto de nuevos trabajos de investigación propone formas de reducir el coste de inferencia de los grandes modelos de lenguaje de vídeo y multimodales mediante la poda, fusión u otras formas de compresión de tokens visuales y audiovisuales redundantes. Los métodos incluyen GSTEP para la poda global de tokens de vídeo espaciotemporales, CRAFT para la fusión adaptativa recursiva, ONCE para un codebook global offline, Macer para la compresión omnimodal con presupuesto por modalidad, ET-Prune para la poda visual con abundante texto y consciente de la evidencia, y OmniPack para la compresión omnimodal unificada. Varios trabajos describen enfoques plug-in o sin entrenamiento, mientras que CRAFT incluye componentes de fusión aprendibles.

Pruébalo hoy

Antes de desplegar flujos de trabajo con vídeo largo u omnimodales, evalúa los métodos de compresión de tokens frente a tus tareas objetivo, especialmente en casos con mucho OCR o de audio y vídeo.

Fuentes y cobertura original

Este resumen sintetiza y enlaza la cobertura de los medios siguientes.

¿Te gustó este resumen? Recibe el próximo en tu correo.

Más en Investigación