연구진, 멀티모달 임베딩 모델 UEmbed 공개
UEmbed는 디코더 전용 모델의 한 번의 순전파로 희소 어휘 표현과 밀집 표현을 함께 생성한다.
왜 중요한가
UEmbed는 학습 기반 희소 검색과 밀집 멀티모달 임베딩을 결합하는 더 단순한 아키텍처의 가능성을 보여준다. 어휘 수준의 정밀도와 의미 기반 매칭을 모두 필요로 하는 검색 및 검색 증강 생성 시스템에 의미가 있을 수 있다.
핵심 포인트
- 1.한 번의 인과적 순전파로 희소 임베딩과 밀집 임베딩을 생성한다.
- 2.2B, 4B, 9B 규모로 공개됐다.
- 3.UEmbed-9B는 MMEB-v2에서 밀집 71.8점을 보고했다.
연구진은 단일 인과적 순전파에서 희소 어휘 표현과 밀집 표현을 모두 생성하는 디코더 전용 멀티모달 임베딩 모델 UEmbed를 소개했다. 이 모델은 입력에 학습 가능한 특수 토큰을 덧붙이고, 어휘를 서로 겹치지 않는 하위 집합으로 나눈 뒤 각 토큰의 은닉 상태를 사용해 희소 가중치를 예측한다. 연구팀은 공개 데이터로 학습한 2B, 4B, 9B 버전을 공개했으며, UEmbed-9B는 MMEB-v2에서 밀집 71.8점, 희소 71.0점을 기록했다.
⚡ 오늘 바로 활용
새로운 검색 시스템에 희소·밀집 멀티모달 임베딩 스택을 따로 선택하기 전에 이 논문을 살펴볼 필요가 있다.
출처 및 원본 보도
이 브리핑은 아래 매체의 보도를 요약하고 링크합니다.
이 브리핑이 유용했나요? 다음 소식을 메일로 받아보세요.
관련: 연구
연구
Google, 동형암호로 프라이빗 AI 진전
Google은 동형암호를 활용해 프라이빗 AI를 더 실용적으로 만들고 있다고 밝혔다.
Hacker News+8 outlets·9h ago
연구
Google, private AI를 실용화하고 있다고 밝혀
Google Security 게시물이 Hacker News에서 논의를 불러왔고, 더 넓은 AI 비판과도 맞물렸다.
Hacker News+5 outlets·9h ago
연구
연구진, 통제된 LLM 연구용 LittleLearner 공개
50억 개 파라미터 모델로, 초등학교 5학년 이하 수준의 커리큘럼 말뭉치 880억 토큰으로 학습됐다.
r/LocalLLaMA+1 outlet·14h ago