DistilVDR, 시각 문서 검색을 압축하다
5억2400만 매개변수 규모의 검색 모델이 80억 매개변수 비전-언어 교사 모델로부터 양방향 증류를 활용한다.
왜 중요한가
이 연구는 시각 문서 검색의 실질적 병목인 코퍼스 규모에서 수십억 매개변수 또는 다중 벡터 시스템을 색인하고 서빙하는 비용 문제를 겨냥한다. 소형 단일 벡터 VDR 모델이 더 단순한 서빙 요건으로도 대형 교사 모델의 검색 품질 상당 부분을 유지할 수 있음을 시사한다.
핵심 포인트
- 1.DistilVDR은 5억2400만 매개변수 규모의 엔드투엔드 VDR 시스템이다.
- 2.학습은 동결된 교사 모델의 임베딩 공간만 사용한다.
- 3.HiRes는 ViDoRe v1+v2+v3에서 평균 NDCG@5 61.74를 달성했다.
연구진은 동결된 80억 매개변수 비전-언어 교사 모델에서 증류한 5억2400만 매개변수 규모의 엔드투엔드 시각 문서 검색 시스템 DistilVDR을 공개했다. 이 시스템은 7000만 매개변수 규모의 쿼리 측을 포함한 소형 비대칭 인코더 구성을 사용하며, 학생 모델 학습에 관련성 라벨, 네거티브 샘플링, 대조 항이 필요하지 않다. HiRes 변형은 ViDoRe v1+v2+v3에서 평균 NDCG@5 61.74를 기록해 교사 모델의 86.9% 수준에 도달했으며, v3 벤치마크에서 재현된 10억 미만 매개변수 기준 모델들을 앞섰다.
⚡ 오늘 바로 활용
문서 검색 워크로드에 대형 VDR 모델을 선택하기 전에 DistilVDR 논문을 읽어볼 필요가 있다.
출처 및 원본 보도
이 브리핑은 아래 매체의 보도를 요약하고 링크합니다.
- arXiv cs.CLDistilVDR: A Compact End-to-End Visual Document Retriever via Dual-Student DistillationAug 12, 12:00 PM↗
- arXiv cs.CLAnchorFold: A Focus-Then-Fold Framework via Recursive Attention Propagation for Efficient Multi-Vector Visual Document RetrievalAug 11, 12:00 PM↗
- HF Daily PapersDistilVDR: A Compact End-to-End Visual Document Retriever via Dual-Student DistillationAug 11, 4:00 AM↗
이 브리핑이 유용했나요? 다음 소식을 메일로 받아보세요.
관련: 연구
연구진, 통제된 LLM 연구용 LittleLearner 공개
50억 개 파라미터 모델로, 초등학교 5학년 이하 수준의 커리큘럼 말뭉치 880억 토큰으로 학습됐다.
HN, AI의 한계와 프라이버시·과학적 주장 놓고 논쟁
신약 개발, 수학, 프라이버시, AI 연구소를 다룬 게시물들이 Hacker News에서 활발한 토론을 불러왔다.
연구진, VLM의 공간 추론 한계 겨냥
새 논문들이 비전-언어 시스템의 공간 지능을 높이기 위한 메모리, RL, 벤치마크를 제안했다.