LiquidAI lanza LFM2.5-VL-3B en Hugging Face
El modelo multimodal de la categoría de 3B apunta a tareas de visión en el edge con soporte para texto, imagen, OCR y grounding.
Por qué importa
El lanzamiento suma otro modelo multimodal pequeño orientado al despliegue local y en el edge, donde el uso de memoria y la velocidad de inferencia son restricciones centrales. Su soporte para OCR, grounding y múltiples idiomas podría ampliar los flujos prácticos de visión en dispositivos.
Puntos clave
- 1.Apunta al procesamiento multimodal de texto e imagen en dispositivos.
- 2.Usa LFM2.5-2.6B con un codificador de visión SigLIP2 NaFlex.
- 3.Reporta un uso de memoria inferior a 3.3 GB para inferencia.
LiquidAI lanzó LFM2.5-VL-3B en Hugging Face, una variante multimodal de su familia de modelos híbridos LFM2.5 diseñada para despliegue en dispositivos. El modelo procesa texto e imágenes, utiliza el modelo de lenguaje LFM2.5-2.6B como base y lo combina con un codificador de visión SigLIP2 NaFlex 400M. Entre las capacidades reportadas figuran mejoras en grounding y detección de objetos mediante consultas en lenguaje natural, OCR de página completa con anotación de diseño e inferencia con menos de 3.3 GB de memoria.
⚡ Pruébalo hoy
Evalúa LFM2.5-VL-3B en Hugging Face para tareas locales de OCR, grounding e imagen-texto antes de optar por un modelo de visión más grande.
Fuentes y cobertura original
Este resumen sintetiza y enlaza la cobertura de los medios siguientes.
¿Te gustó este resumen? Recibe el próximo en tu correo.
Más en Modelos
Google lanza Gemini 3.7 Flash
El nuevo modelo Flash apunta a programación, agentes y automatización de flujos de trabajo con precios introductorios.
Google lanza Gemini 3.7 Flash para programación y agentes
El nuevo modelo Flash está disponible en Gemini API, Google AI Studio, Android Studio y herramientas empresariales.
Meta lanza Glimmer, un modelo de IA de pesos abiertos
El modelo se puede descargar y ejecutar localmente, mientras Meta mantiene Muse Spark detrás de APIs.