UniME-R1、マルチモーダル検索にハードネガティブを活用
この手法は、クエリ単独ではなく候補からのフィードバックに基づいて、chain-of-thoughtによる検索を条件づける。
なぜ重要か
この研究は、大規模な視覚言語検索モデルに共通する弱点、すなわち細かな手がかりを見落とした際に意味的に似た候補を混同してしまう問題に対処するものだ。検索フィードバックに基づいて推論を条件づけることで、複雑なユーザー意図に対するマルチモーダル検索システムの堅牢性が高まる可能性がある。
要点
- 1.UniME-R1は、検索された候補を分析するadviserを追加する。
- 2.検索フィードバックから、検索中心のchain-of-thoughtを生成する。
- 3.この手法は、マルチモーダル検索における細粒度の混同を対象としている。
研究者らは、統合型マルチモーダル検索に向けたembedder-adviserフレームワーク「UniME-R1」を発表した。このシステムは、最初に検索された候補を分析し、embedderが見落とした識別的な手がかりを特定する。そのうえで、対象が含まれていれば初期の上位k件を再ランキングし、含まれていなければ検索方向を絞り込むための検索中心のchain-of-thoughtを生成する。
⚡ 今日から使える
マルチモーダル検索パイプラインにクエリ単独の推論を追加する前に、ハードネガティブを使って検索失敗を評価すべきだ。
出典・一次報道
本記事は以下の媒体の報道を要約し、リンクしています。
この記事が役に立ちましたか?次号をメールでお届けします。
関連: 研究
研究
Google、準同型暗号でプライベートAIを前進
Googleは、準同型暗号を活用してプライベートAIをより実用的にしようとしていると説明している。
Hacker News+8 outlets·9h ago
研究
Google、プライベートAIの実用化を進めていると説明
Google Securityの投稿がHacker Newsで議論を呼び、AI全般への批判とも並んだ。
Hacker News+5 outlets·9h ago
研究
研究者ら、LLMを制御下で研究するためのLittleLearnerを公開
50億パラメータのモデルは、小学5年生以下のカリキュラムに基づく880億トークンのコーパスで訓練された。
r/LocalLLaMA+1 outlet·14h ago