AAI News Hub
ForschungTue, August 4, 2026·Aug 42 sources corroborating

Video-DR zielt auf Deep Research über kontinuierliche Videos

Das arXiv-Paper stellt einen videobasierten multimodalen Agenten und einen Benchmark mit 200 Aufgaben vor.

Warum es wichtig ist

Die Arbeit macht Evaluations- und Trainingslücken bei Agenten sichtbar, die über Video statt über statische Bilder schlussfolgern müssen. Der Benchmark und die Einschränkungen bei der Tool-Nutzung könnten mitprägen, wie Labore multimodale Research-Agenten auf fundierte Ausführung testen.

Die Kernpunkte

  • 1.Video-DR erweitert Deep-Research-Agenten von statischen Bildern auf kontinuierliche Videos.
  • 2.Video-DR-Bench umfasst 200 komplexe Multi-Hop-VQA-Instanzen.
  • 3.Das berichtete Ergebnis von Video-DeepResearch-35B-A3B liegt bei 64,0 % durchschnittlicher Genauigkeit.

Forschende haben Video-DeepResearch, kurz Video-DR, vorgestellt: ein Framework für multimodale Agenten, das auf Deep Research über kontinuierliche Videostreams mit Exploration im offenen Web ausgelegt ist. Dem Paper zufolge zeigen aktuelle Modelle einen Modalitätsbias, indem sie visuelle Tools zugunsten der Textsuche umgehen, sowie Leakage parametrischen Wissens, indem sie sich eher auf internes Gedächtnis als auf Tool-Nutzung stützen. Video-DR nutzt eine entkoppelte Wahrnehmungs- und Explorationspipeline, stufenweise Tool-Freischaltung, Supervised Fine-Tuning und GRPO; das Modell Video-DeepResearch-35B-A3B erreichte auf dem neuen Video-DR-Bench mit 200 Instanzen eine durchschnittliche Genauigkeit von 64,0 %.

Heute ausprobieren

Lesen Sie das Paper und das Benchmark-Design, bevor Sie Video-Research-Agenten entwickeln, die visuelle Grounding-Fähigkeiten mit Web-Retrieval verbinden.

Quellen & Originalberichte

Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.

Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.

Mehr in Forschung