AAI News Hub
ForschungTue, August 4, 2026·Aug 42 sources corroborating

Forscher nehmen Token-Kosten in Video- und omni-modalen LLMs ins Visier

Sechs neue Papers schlagen Pruning- oder Kompressionsmethoden für Video-, visuelle und audiovisuell-visuelle Modell-Token vor.

Warum es wichtig ist

Lange Video- und omni-modale Eingaben können Inferenz teuer machen, weil die Zahl der Token mit räumlicher, zeitlicher und modaler Abdeckung wächst. Die Papers verweisen auf eine gemeinsame Forschungsrichtung: aufgabenrelevante Evidenz zu erhalten und zugleich redundante Token vor oder während der LLM-Verarbeitung zu reduzieren.

Die Kernpunkte

  • 1.Forscher bekämpfen die Kosten multimodaler Inferenz mit Token-Pruning, Token-Merging und Codebooks.
  • 2.Mehrere Methoden betonen globalen Kontext statt rein lokaler Salienzentscheidungen.
  • 3.OCR-lastige und Audio-Video-Aufgaben benötigen möglicherweise aufgaben- oder modalitätsbewusste Token-Budgets.

Eine Reihe neuer Forschungsarbeiten stellt Ansätze vor, um die Inferenzkosten von Video- und multimodalen Large Language Models zu senken, indem redundante visuelle und audiovisuell-visuelle Token beschnitten, zusammengeführt oder anderweitig komprimiert werden. Zu den Methoden gehören GSTEP für globales räumlich-zeitliches Video-Token-Pruning, CRAFT für rekursive adaptive Fusion, ONCE für ein offline erstelltes globales Codebook, Macer für omni-modale Kompression mit Modalitätsbudget, ET-Prune für evidenzbewusstes Pruning textreicher visueller Inhalte und OmniPack für einheitliche omni-modale Kompression. Mehrere Papers beschreiben Plug-in- oder trainingsfreie Ansätze, während CRAFT lernbare Fusionskomponenten enthält.

Heute ausprobieren

Vor dem Einsatz von Workflows für lange Videos oder omni-modale Inhalte sollten Token-Kompressionsmethoden gegen die jeweiligen Zielaufgaben benchmarked werden, besonders bei OCR-lastigen oder Audio-Video-Szenarien.

Quellen & Originalberichte

Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.

Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.

Mehr in Forschung