DistilVDR komprimiert die visuelle Dokumentensuche
Der Retriever mit 524 Millionen Parametern nutzt bilaterale Destillation von einem 8B-Vision-Language-Lehrmodell.
Warum es wichtig ist
Die Arbeit adressiert einen praktischen Engpass bei der visuellen Dokumentensuche: die Kosten für Indexierung und Bereitstellung von Systemen mit mehreren Milliarden Parametern oder Multi-Vector-Architekturen auf Korpusgröße. Sie deutet darauf hin, dass kompakte Single-Vector-VDR-Modelle einen großen Teil der Retrieval-Qualität eines größeren Lehrmodells bewahren können, bei einfacheren Anforderungen an den Betrieb.
Die Kernpunkte
- 1.DistilVDR ist ein End-to-End-VDR-System mit 524 Millionen Parametern.
- 2.Das Training nutzt ausschließlich den Embedding-Raum des eingefrorenen Lehrmodells.
- 3.HiRes erreicht einen durchschnittlichen NDCG@5-Wert von 61,74 auf ViDoRe v1+v2+v3.
Forscher haben DistilVDR vorgestellt, ein End-to-End-System für visuelle Dokumentensuche mit 524 Millionen Parametern, das aus einem eingefrorenen 8B-Vision-Language-Lehrmodell destilliert wurde. Das System verwendet eine kompakte asymmetrische Encoder-Architektur, darunter eine Query-Seite mit 70 Millionen Parametern, und benötigt für das Training des Student-Modells keine Relevanzlabels, kein Negative Sampling und keinen kontrastiven Term. Die HiRes-Variante meldet einen durchschnittlichen NDCG@5-Wert von 61,74 auf ViDoRe v1+v2+v3, was 86,9 % des Lehrmodells entspricht, und führt die reproduzierten Sub-1B-Baselines im v3-Benchmark an.
⚡ Heute ausprobieren
Lesen Sie das DistilVDR-Paper, bevor Sie ein großes VDR-Modell für Dokumentensuch-Workloads auswählen.
Quellen & Originalberichte
Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.
- arXiv cs.CLDistilVDR: A Compact End-to-End Visual Document Retriever via Dual-Student DistillationAug 12, 12:00 PM↗
- arXiv cs.CLAnchorFold: A Focus-Then-Fold Framework via Recursive Attention Propagation for Efficient Multi-Vector Visual Document RetrievalAug 11, 12:00 PM↗
- HF Daily PapersDistilVDR: A Compact End-to-End Visual Document Retriever via Dual-Student DistillationAug 11, 4:00 AM↗
Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.
Mehr in Forschung
HarnessRisk bewertet Sicherheitsversagen in Agent-Harnesses
Der Benchmark testet Angriffe über verschiedene Phasen von Agent-Harnesses hinweg, während verwandte Arbeiten aufgabenspezifische Bereitstellung untersuchen.
Agent Lightning v1.0 zielt auf agentisches RL mit Harness ab
Das Framework verbindet beliebige Agent-Harnesses mit Post-Training per Reinforcement Learning.
Studie testet modellübergreifende Speicherübertragung für LLMs
Forschende untersuchen, wie sich eingefrorener gelernter Speicher mithilfe eines Readers auf Zielseite zwischen Modell-Backbones übertragen lässt.