DistilVDR 压缩视觉文档检索
这款 5.24 亿参数检索器通过一位 80 亿参数视觉语言教师模型进行双向蒸馏。
为什么重要
这项工作瞄准了视觉文档检索中的一个现实瓶颈:在语料库规模下,为数十亿参数或多向量系统建立索引和提供服务的成本。它表明,紧凑的单向量 VDR 模型或许能在服务要求更简单的情况下,保留大型教师模型的大部分检索质量。
核心要点
- 1.DistilVDR 是一套 5.24 亿参数的端到端 VDR 系统。
- 2.训练仅使用冻结教师模型的嵌入空间。
- 3.HiRes 在 ViDoRe v1+v2+v3 上达到 61.74 的平均 NDCG@5。
研究人员推出了 DistilVDR,这是一套 5.24 亿参数的端到端视觉文档检索系统,由冻结的 80 亿参数视觉语言教师模型蒸馏而来。该系统采用紧凑的非对称编码器架构,其中查询侧为 7000 万参数,并且在学生模型训练中不需要相关性标签、负采样或对比项。其 HiRes 版本在 ViDoRe v1+v2+v3 上报告的平均 NDCG@5 为 61.74,达到教师模型的 86.9%,并在 v3 基准上领先可复现的 10 亿参数以下基线。
⚡ 今天就能用
在为文档搜索工作负载选择大型 VDR 模型之前,先阅读 DistilVDR 论文。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
- arXiv cs.CLDistilVDR: A Compact End-to-End Visual Document Retriever via Dual-Student DistillationAug 12, 12:00 PM↗
- arXiv cs.CLAnchorFold: A Focus-Then-Fold Framework via Recursive Attention Propagation for Efficient Multi-Vector Visual Document RetrievalAug 11, 12:00 PM↗
- HF Daily PapersDistilVDR: A Compact End-to-End Visual Document Retriever via Dual-Student DistillationAug 11, 4:00 AM↗
觉得这篇简报有用?下一篇直接送到你的邮箱。