LiquidAI lança LFM2.5-VL-3B no Hugging Face
O modelo multimodal da classe 3B mira tarefas de visão em edge com suporte a texto, imagem, OCR e grounding.
Por que importa
O lançamento acrescenta mais um modelo multimodal pequeno voltado à implantação local e em edge, onde uso de memória e velocidade de inferência são restrições centrais. Seu suporte a OCR, grounding e múltiplos idiomas pode ampliar fluxos práticos de visão executados no próprio dispositivo.
Pontos-chave
- 1.Mira processamento multimodal de texto e imagem no próprio dispositivo.
- 2.Usa o LFM2.5-2.6B com um encoder de visão SigLIP2 NaFlex.
- 3.Relata uso de menos de 3,3 GB de memória para inferência.
A LiquidAI lançou no Hugging Face o LFM2.5-VL-3B, uma variante multimodal de sua família de modelos híbridos LFM2.5 projetada para implantação em dispositivos. O modelo processa texto e imagens, usa o modelo de linguagem LFM2.5-2.6B como base e o combina com um encoder de visão SigLIP2 NaFlex 400M. Entre as capacidades relatadas estão grounding e detecção de objetos aprimorados com consultas em linguagem natural, OCR de página inteira com anotação de layout e inferência com menos de 3,3 GB de memória.
⚡ Experimente hoje
Avalie o LFM2.5-VL-3B no Hugging Face para tarefas locais de OCR, grounding e imagem-texto antes de escolher um modelo de visão maior.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Modelos
Google lança o Gemini 3.7 Flash
O novo modelo Flash mira programação, agentes e automação de fluxos de trabalho com preço introdutório.
Meta lança modelo de IA Glimmer com pesos abertos
O modelo pode ser baixado e executado localmente, enquanto a Meta mantém o Muse Spark restrito a APIs.
Mistral lista GLM-5.2 e OCR 4.1 em sua documentação
Publicações da comunidade chamaram atenção para a documentação da Mistral sobre o GLM-5.2, da Z.ai, e o Mistral OCR 4.1.