AAI News Hub
ModelosWed, August 12, 2026·3d ago2 sources corroborating

LiquidAI lanza LFM2.5-VL-3B en Hugging Face

El modelo multimodal de la categoría de 3B apunta a tareas de visión en el edge con soporte para texto, imagen, OCR y grounding.

Por qué importa

El lanzamiento suma otro modelo multimodal pequeño orientado al despliegue local y en el edge, donde el uso de memoria y la velocidad de inferencia son restricciones centrales. Su soporte para OCR, grounding y múltiples idiomas podría ampliar los flujos prácticos de visión en dispositivos.

Puntos clave

  • 1.Apunta al procesamiento multimodal de texto e imagen en dispositivos.
  • 2.Usa LFM2.5-2.6B con un codificador de visión SigLIP2 NaFlex.
  • 3.Reporta un uso de memoria inferior a 3.3 GB para inferencia.

LiquidAI lanzó LFM2.5-VL-3B en Hugging Face, una variante multimodal de su familia de modelos híbridos LFM2.5 diseñada para despliegue en dispositivos. El modelo procesa texto e imágenes, utiliza el modelo de lenguaje LFM2.5-2.6B como base y lo combina con un codificador de visión SigLIP2 NaFlex 400M. Entre las capacidades reportadas figuran mejoras en grounding y detección de objetos mediante consultas en lenguaje natural, OCR de página completa con anotación de diseño e inferencia con menos de 3.3 GB de memoria.

Pruébalo hoy

Evalúa LFM2.5-VL-3B en Hugging Face para tareas locales de OCR, grounding e imagen-texto antes de optar por un modelo de visión más grande.

Fuentes y cobertura original

Este resumen sintetiza y enlaza la cobertura de los medios siguientes.

¿Te gustó este resumen? Recibe el próximo en tu correo.

Más en Modelos