AAI News Hub
ForschungWed, August 12, 2026·Aug 122 sources corroborating

DistilVDR komprimiert die visuelle Dokumentensuche

Der Retriever mit 524 Millionen Parametern nutzt bilaterale Destillation von einem 8B-Vision-Language-Lehrmodell.

Warum es wichtig ist

Die Arbeit adressiert einen praktischen Engpass bei der visuellen Dokumentensuche: die Kosten für Indexierung und Bereitstellung von Systemen mit mehreren Milliarden Parametern oder Multi-Vector-Architekturen auf Korpusgröße. Sie deutet darauf hin, dass kompakte Single-Vector-VDR-Modelle einen großen Teil der Retrieval-Qualität eines größeren Lehrmodells bewahren können, bei einfacheren Anforderungen an den Betrieb.

Die Kernpunkte

  • 1.DistilVDR ist ein End-to-End-VDR-System mit 524 Millionen Parametern.
  • 2.Das Training nutzt ausschließlich den Embedding-Raum des eingefrorenen Lehrmodells.
  • 3.HiRes erreicht einen durchschnittlichen NDCG@5-Wert von 61,74 auf ViDoRe v1+v2+v3.

Forscher haben DistilVDR vorgestellt, ein End-to-End-System für visuelle Dokumentensuche mit 524 Millionen Parametern, das aus einem eingefrorenen 8B-Vision-Language-Lehrmodell destilliert wurde. Das System verwendet eine kompakte asymmetrische Encoder-Architektur, darunter eine Query-Seite mit 70 Millionen Parametern, und benötigt für das Training des Student-Modells keine Relevanzlabels, kein Negative Sampling und keinen kontrastiven Term. Die HiRes-Variante meldet einen durchschnittlichen NDCG@5-Wert von 61,74 auf ViDoRe v1+v2+v3, was 86,9 % des Lehrmodells entspricht, und führt die reproduzierten Sub-1B-Baselines im v3-Benchmark an.

Heute ausprobieren

Lesen Sie das DistilVDR-Paper, bevor Sie ein großes VDR-Modell für Dokumentensuch-Workloads auswählen.

Quellen & Originalberichte

Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.

Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.

Mehr in Forschung