LiquidAI, Hugging Face에 LFM2.5-VL-3B 공개
3B급 멀티모달 모델로, 텍스트·이미지·OCR·그라운딩을 지원하며 엣지 비전 작업을 겨냥했다.
왜 중요한가
이번 공개로 메모리 사용량과 추론 속도가 핵심 제약인 로컬 및 엣지 배포를 겨냥한 또 하나의 소형 멀티모달 모델이 추가됐다. OCR, 그라운딩, 다국어 지원은 실용적인 온디바이스 비전 워크플로를 넓힐 수 있다.
핵심 포인트
- 1.온디바이스 멀티모달 텍스트 및 이미지 처리를 겨냥한다.
- 2.SigLIP2 NaFlex 비전 인코더와 함께 LFM2.5-2.6B를 사용한다.
- 3.추론 시 메모리 사용량이 3.3GB 미만이라고 보고됐다.
LiquidAI가 온디바이스 배포를 위해 설계한 LFM2.5 하이브리드 모델 제품군의 멀티모달 변형인 LFM2.5-VL-3B를 Hugging Face에 공개했다. 이 모델은 텍스트와 이미지를 처리하며, LFM2.5-2.6B 언어 모델을 백본으로 사용하고 SigLIP2 NaFlex 400M 비전 인코더와 결합했다. 보고된 기능에는 자연어 질의를 통한 개선된 그라운딩 및 객체 감지, 레이아웃 주석을 포함한 전체 페이지 OCR, 3.3GB 미만 메모리에서의 추론이 포함된다.
⚡ 오늘 바로 활용
더 큰 비전 모델을 선택하기 전에 Hugging Face에서 LFM2.5-VL-3B를 로컬 OCR, 그라운딩, 이미지-텍스트 작업에 평가해볼 만하다.
출처 및 원본 보도
이 브리핑은 아래 매체의 보도를 요약하고 링크합니다.
이 브리핑이 유용했나요? 다음 소식을 메일로 받아보세요.
관련: 모델
Google, Gemini 3.7 Flash 출시
새 Flash 모델은 코딩, 에이전트, 워크플로 자동화를 겨냥하며 초기 도입 가격으로 제공된다.
Google, 코딩과 에이전트용 Gemini 3.7 Flash 출시
새 Flash 모델은 Gemini API, Google AI Studio, Android Studio 및 기업용 도구에서 사용할 수 있다.
Meta, 오픈 웨이트 AI 모델 Glimmer 공개
이 모델은 다운로드해 로컬에서 실행할 수 있지만, Meta는 Muse Spark를 API 뒤에 두고 있다.