研究者ら、マルチモーダル埋め込みモデル「UEmbed」を公開
UEmbedは、decoder-onlyの1回のforward passで、スパースな語彙表現と密な表現を生成する。
なぜ重要か
UEmbedは、学習型のスパース検索と密なマルチモーダル埋め込みを組み合わせる、よりシンプルなアーキテクチャを示している。語彙レベルの精度と意味的なマッチングの両方を必要とする検索システムや検索拡張生成システムにとって重要になり得る。
要点
- 1.1回の因果的passでスパース埋め込みと密な埋め込みを生成する。
- 2.2B、4B、9Bの各規模で公開された。
- 3.UEmbed-9BはMMEB-v2でdense 71.8を報告している。
研究者らは、decoder-onlyのマルチモーダル埋め込みモデル「UEmbed」を発表した。単一の因果的forward passで、スパースな語彙表現と密な表現の両方を生成する。モデルは入力に学習可能な特殊トークンを追加し、語彙を互いに重ならないサブセットに分割したうえで、各トークンの隠れ状態を使ってスパース重みを予測する。チームは公開データで学習した2B、4B、9B版を公開しており、UEmbed-9BはMMEB-v2でdense 71.8、sparse 71.0を記録した。
⚡ 今日から使える
新しい検索システム向けにスパースと密なマルチモーダル埋め込みのスタックを別々に選ぶ前に、この論文を読んでおきたい。
出典・一次報道
本記事は以下の媒体の報道を要約し、リンクしています。
この記事が役に立ちましたか?次号をメールでお届けします。
関連: 研究
研究
Google、準同型暗号でプライベートAIを前進
Googleは、準同型暗号を活用してプライベートAIをより実用的にしようとしていると説明している。
Hacker News+8 outlets·15h ago
研究
Google、プライベートAIの実用化を進めていると説明
Google Securityの投稿がHacker Newsで議論を呼び、AI全般への批判とも並んだ。
Hacker News+5 outlets·15h ago
研究
研究者ら、LLMを制御下で研究するためのLittleLearnerを公開
50億パラメータのモデルは、小学5年生以下のカリキュラムに基づく880億トークンのコーパスで訓練された。
r/LocalLLaMA+1 outlet·20h ago