AAI News Hub
研究Wed, August 12, 2026·4d ago2 sources corroborating

DistilVDR、視覚文書検索を圧縮

5億2400万パラメータの検索器は、80億パラメータの視覚言語教師モデルから双方向蒸留を行う。

なぜ重要か

この研究は、視覚文書検索における実務上のボトルネック、つまり数十億パラメータ規模のモデルやマルチベクトル方式をコーパス規模でインデックス化し、配信するコストに狙いを定めている。小型の単一ベクトルVDRモデルでも、より大きな教師モデルの検索品質の多くを維持しつつ、より簡素な配信要件で運用できる可能性を示している。

要点

  • 1.DistilVDRは5億2400万パラメータのエンドツーエンドVDRシステム。
  • 2.学習には凍結された教師モデルの埋め込み空間のみを使う。
  • 3.HiResはViDoRe v1+v2+v3で平均NDCG@5 61.74に到達した。

研究者らは、凍結された80億パラメータの視覚言語教師モデルから蒸留した、5億2400万パラメータのエンドツーエンド視覚文書検索システム「DistilVDR」を発表した。このシステムは、7000万パラメータのクエリ側を含む小型の非対称エンコーダ構成を採用し、学生モデルの学習に関連性ラベル、ネガティブサンプリング、コントラスト項を必要としない。HiRes版はViDoRe v1+v2+v3で平均NDCG@5が61.74と報告され、教師モデルの86.9%に相当し、v3ベンチマークでは再現された10億パラメータ未満のベースラインを上回った。

今日から使える

文書検索ワークロード向けに大規模VDRモデルを選ぶ前に、DistilVDRの論文を読んでおきたい。

出典・一次報道

本記事は以下の媒体の報道を要約し、リンクしています。

この記事が役に立ちましたか?次号をメールでお届けします。

関連: 研究