DistilVDR、視覚文書検索を圧縮
5億2400万パラメータの検索器は、80億パラメータの視覚言語教師モデルから双方向蒸留を行う。
なぜ重要か
この研究は、視覚文書検索における実務上のボトルネック、つまり数十億パラメータ規模のモデルやマルチベクトル方式をコーパス規模でインデックス化し、配信するコストに狙いを定めている。小型の単一ベクトルVDRモデルでも、より大きな教師モデルの検索品質の多くを維持しつつ、より簡素な配信要件で運用できる可能性を示している。
要点
- 1.DistilVDRは5億2400万パラメータのエンドツーエンドVDRシステム。
- 2.学習には凍結された教師モデルの埋め込み空間のみを使う。
- 3.HiResはViDoRe v1+v2+v3で平均NDCG@5 61.74に到達した。
研究者らは、凍結された80億パラメータの視覚言語教師モデルから蒸留した、5億2400万パラメータのエンドツーエンド視覚文書検索システム「DistilVDR」を発表した。このシステムは、7000万パラメータのクエリ側を含む小型の非対称エンコーダ構成を採用し、学生モデルの学習に関連性ラベル、ネガティブサンプリング、コントラスト項を必要としない。HiRes版はViDoRe v1+v2+v3で平均NDCG@5が61.74と報告され、教師モデルの86.9%に相当し、v3ベンチマークでは再現された10億パラメータ未満のベースラインを上回った。
⚡ 今日から使える
文書検索ワークロード向けに大規模VDRモデルを選ぶ前に、DistilVDRの論文を読んでおきたい。
出典・一次報道
本記事は以下の媒体の報道を要約し、リンクしています。
- arXiv cs.CLDistilVDR: A Compact End-to-End Visual Document Retriever via Dual-Student DistillationAug 12, 12:00 PM↗
- arXiv cs.CLAnchorFold: A Focus-Then-Fold Framework via Recursive Attention Propagation for Efficient Multi-Vector Visual Document RetrievalAug 11, 12:00 PM↗
- HF Daily PapersDistilVDR: A Compact End-to-End Visual Document Retriever via Dual-Student DistillationAug 11, 4:00 AM↗
この記事が役に立ちましたか?次号をメールでお届けします。
関連: 研究
研究
研究者ら、VLMの空間推論の弱点に照準
新たな論文群が、視覚言語システムの空間知能に向けて、記憶、RL、ベンチマークを提案している。
arXiv cs.AI+1 outlet·1d ago
研究
Google、コーディングとエージェント向けにGemini 3.7 Flashを発表
新しいFlashモデルは、Gemini API、Google AI Studio、Android Studio、企業向けツールで利用できる。
Hacker News+13 outlets·1d ago
研究
新研究、視覚AIの空間知能を検証
SpaRRTa、SMA、PinpointQAは、視覚AIや身体性AIシステムの空間推論を評価・改善する。
arXiv cs.LG+1 outlet·2d ago