AAI News Hub
ModelleWed, August 12, 2026·6d ago2 sources corroborating

LiquidAI veröffentlicht LFM2.5-VL-3B auf Hugging Face

Das multimodale Modell der 3B-Klasse zielt auf Vision-Aufgaben am Edge ab und unterstützt Text, Bilder, OCR und Grounding.

Warum es wichtig ist

Die Veröffentlichung ergänzt das Angebot kleiner multimodaler Modelle für lokale und Edge-Deployments, bei denen Speicherverbrauch und Inferenzgeschwindigkeit zentrale Einschränkungen sind. Die Unterstützung für OCR, Grounding und Mehrsprachigkeit könnte praktische Vision-Workflows direkt auf Geräten breiter nutzbar machen.

Die Kernpunkte

  • 1.Zielt auf multimodale Text- und Bildverarbeitung direkt auf Geräten ab.
  • 2.Nutzt LFM2.5-2.6B mit einem SigLIP2 NaFlex Vision Encoder.
  • 3.Meldet weniger als 3,3 GB Speicherbedarf für die Inferenz.

LiquidAI hat LFM2.5-VL-3B auf Hugging Face veröffentlicht, eine multimodale Variante seiner hybriden LFM2.5-Modellfamilie, die für den Einsatz direkt auf Geräten entwickelt wurde. Das Modell verarbeitet Text und Bilder, nutzt das Sprachmodell LFM2.5-2.6B als Backbone und kombiniert es mit einem SigLIP2 NaFlex 400M Vision Encoder. Zu den berichteten Fähigkeiten gehören verbessertes Grounding und Objekterkennung mit natürlichsprachlichen Abfragen, ganzseitige OCR mit Layout-Annotation sowie Inferenz mit weniger als 3,3 GB Speicherbedarf.

Heute ausprobieren

Prüfen Sie LFM2.5-VL-3B auf Hugging Face für lokale OCR-, Grounding- und Bild-Text-Aufgaben, bevor Sie sich für ein größeres Vision-Modell entscheiden.

Quellen & Originalberichte

Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.

Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.

Mehr in Modelle