LiquidAI 在 Hugging Face 发布 LFM2.5-VL-3B
这款 3B 级多模态模型面向边缘端视觉任务,支持文本、图像、OCR 和 grounding。
为什么重要
这一发布为本地和边缘端部署增加了又一款小型多模态模型。在这类场景中,内存占用和推理速度是关键限制。其 OCR、grounding 和多语言支持,可能拓宽端侧视觉工作流的实际应用范围。
核心要点
- 1.面向端侧多模态文本和图像处理。
- 2.采用 LFM2.5-2.6B,并搭配 SigLIP2 NaFlex 视觉编码器。
- 3.报告称推理内存占用低于 3.3 GB。
LiquidAI 在 Hugging Face 发布了 LFM2.5-VL-3B,这是其 LFM2.5 混合模型家族的多模态版本,面向端侧部署设计。该模型可处理文本和图像,以 LFM2.5-2.6B 语言模型为骨干,并搭配 SigLIP2 NaFlex 400M 视觉编码器。官方披露的能力包括:通过自然语言查询提升 grounding 和目标检测表现,支持带版面标注的整页 OCR,并可在低于 3.3 GB 内存的条件下完成推理。
⚡ 今天就能用
在选择更大的视觉模型之前,可先在 Hugging Face 上评估 LFM2.5-VL-3B 用于本地 OCR、grounding 和图文任务的表现。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
觉得这篇简报有用?下一篇直接送到你的邮箱。