LiquidAI publie LFM2.5-VL-3B sur Hugging Face
Ce modèle multimodal de la classe 3B vise les tâches de vision en périphérie, avec prise en charge du texte, des images, de l’OCR et du grounding.
Pourquoi c'est important
Cette publication ajoute un nouveau petit modèle multimodal destiné au déploiement local et en périphérie, où l’usage mémoire et la vitesse d’inférence sont des contraintes majeures. Ses capacités d’OCR, de grounding et de prise en charge multilingue pourraient élargir les usages pratiques de la vision directement sur appareil.
Points clés
- 1.Vise le traitement multimodal du texte et des images directement sur appareil.
- 2.Utilise LFM2.5-2.6B avec un encodeur visuel SigLIP2 NaFlex.
- 3.Annonce une utilisation mémoire inférieure à 3,3 Go pour l’inférence.
LiquidAI a publié LFM2.5-VL-3B sur Hugging Face, une variante multimodale de sa famille de modèles hybrides LFM2.5 conçue pour le déploiement sur appareil. Le modèle traite le texte et les images, s’appuie sur le modèle de langage LFM2.5-2.6B comme colonne vertébrale et l’associe à un encodeur visuel SigLIP2 NaFlex 400M. Parmi les capacités annoncées figurent un meilleur grounding et une meilleure détection d’objets via des requêtes en langage naturel, l’OCR de pages complètes avec annotation de la mise en page, ainsi qu’une inférence nécessitant moins de 3,3 Go de mémoire.
⚡ À tester aujourd'hui
Évaluez LFM2.5-VL-3B sur Hugging Face pour les tâches locales d’OCR, de grounding et d’image-texte avant d’opter pour un modèle de vision plus volumineux.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Modèles
Google lance Gemini 3.7 Flash
Le nouveau modèle Flash vise le codage, les agents et l’automatisation des workflows à un tarif de lancement.
Meta publie Glimmer, un modèle d’IA à poids ouverts
Le modèle peut être téléchargé et exécuté localement, tandis que Meta garde Muse Spark derrière des APIs.
Mistral mentionne GLM-5.2 et OCR 4.1 dans sa documentation
Des publications de la communauté ont signalé la documentation de Mistral consacrée à GLM-5.2 de Z.ai et à Mistral OCR 4.1.