DistilVDR comprime la recuperación de documentos visuales
El recuperador de 524 millones de parámetros usa destilación bilateral a partir de un modelo docente de visión-lenguaje de 8B.
Por qué importa
El trabajo aborda un cuello de botella práctico en la recuperación de documentos visuales: el costo de indexar y servir sistemas de miles de millones de parámetros o multivectoriales a escala de corpus. Sugiere que los modelos VDR compactos de vector único pueden conservar gran parte de la calidad de recuperación de un docente más grande con requisitos de servicio más simples.
Puntos clave
- 1.DistilVDR es un sistema VDR integral de 524 millones de parámetros.
- 2.El entrenamiento usa únicamente el espacio de embeddings del docente congelado.
- 3.HiRes alcanza un NDCG@5 promedio de 61.74 en ViDoRe v1+v2+v3.
Investigadores presentaron DistilVDR, un sistema integral de recuperación de documentos visuales con 524 millones de parámetros, destilado a partir de un modelo docente de visión-lenguaje de 8B congelado. El sistema utiliza una configuración compacta de codificadores asimétricos, incluido un lado de consulta de 70 millones de parámetros, y no requiere etiquetas de relevancia, muestreo negativo ni un término contrastivo para entrenar al estudiante. Su variante HiRes reporta un NDCG@5 promedio de 61.74 en ViDoRe v1+v2+v3, equivalente al 86.9% del desempeño del docente, y lidera las líneas base sub-1B reproducidas en el benchmark v3.
⚡ Pruébalo hoy
Lee el paper de DistilVDR antes de elegir un modelo VDR grande para cargas de trabajo de búsqueda documental.
Fuentes y cobertura original
Este resumen sintetiza y enlaza la cobertura de los medios siguientes.
- arXiv cs.CLDistilVDR: A Compact End-to-End Visual Document Retriever via Dual-Student DistillationAug 12, 12:00 PM↗
- arXiv cs.CLAnchorFold: A Focus-Then-Fold Framework via Recursive Attention Propagation for Efficient Multi-Vector Visual Document RetrievalAug 11, 12:00 PM↗
- HF Daily PapersDistilVDR: A Compact End-to-End Visual Document Retriever via Dual-Student DistillationAug 11, 4:00 AM↗
¿Te gustó este resumen? Recibe el próximo en tu correo.
Más en Investigación
Investigadores apuntan a las brechas de razonamiento espacial en los VLM
Nuevos artículos proponen memoria, RL y benchmarks para la inteligencia espacial en sistemas de visión-lenguaje.
Google lanza Gemini 3.7 Flash para programación y agentes
El nuevo modelo Flash está disponible en Gemini API, Google AI Studio, Android Studio y herramientas empresariales.
Nuevos estudios examinan la inteligencia espacial en la IA de visión
SpaRRTa, SMA y PinpointQA evalúan o mejoran el razonamiento espacial en sistemas de IA visual y encarnada.