AAI News Hub
ModèlesWed, August 12, 2026·4d ago2 sources corroborating

LiquidAI publie LFM2.5-VL-3B sur Hugging Face

Ce modèle multimodal de la classe 3B vise les tâches de vision en périphérie, avec prise en charge du texte, des images, de l’OCR et du grounding.

Pourquoi c'est important

Cette publication ajoute un nouveau petit modèle multimodal destiné au déploiement local et en périphérie, où l’usage mémoire et la vitesse d’inférence sont des contraintes majeures. Ses capacités d’OCR, de grounding et de prise en charge multilingue pourraient élargir les usages pratiques de la vision directement sur appareil.

Points clés

  • 1.Vise le traitement multimodal du texte et des images directement sur appareil.
  • 2.Utilise LFM2.5-2.6B avec un encodeur visuel SigLIP2 NaFlex.
  • 3.Annonce une utilisation mémoire inférieure à 3,3 Go pour l’inférence.

LiquidAI a publié LFM2.5-VL-3B sur Hugging Face, une variante multimodale de sa famille de modèles hybrides LFM2.5 conçue pour le déploiement sur appareil. Le modèle traite le texte et les images, s’appuie sur le modèle de langage LFM2.5-2.6B comme colonne vertébrale et l’associe à un encodeur visuel SigLIP2 NaFlex 400M. Parmi les capacités annoncées figurent un meilleur grounding et une meilleure détection d’objets via des requêtes en langage naturel, l’OCR de pages complètes avec annotation de la mise en page, ainsi qu’une inférence nécessitant moins de 3,3 Go de mémoire.

À tester aujourd'hui

Évaluez LFM2.5-VL-3B sur Hugging Face pour les tâches locales d’OCR, de grounding et d’image-texte avant d’opter pour un modèle de vision plus volumineux.

Sources et articles originaux

Ce brief résume et renvoie vers la couverture des médias ci-dessous.

Ce brief vous a plu ? Recevez le prochain par e-mail.

Plus dans Modèles