LiquidAI veröffentlicht LFM2.5-VL-3B auf Hugging Face
Das multimodale Modell der 3B-Klasse zielt auf Vision-Aufgaben am Edge ab und unterstützt Text, Bilder, OCR und Grounding.
Warum es wichtig ist
Die Veröffentlichung ergänzt das Angebot kleiner multimodaler Modelle für lokale und Edge-Deployments, bei denen Speicherverbrauch und Inferenzgeschwindigkeit zentrale Einschränkungen sind. Die Unterstützung für OCR, Grounding und Mehrsprachigkeit könnte praktische Vision-Workflows direkt auf Geräten breiter nutzbar machen.
Die Kernpunkte
- 1.Zielt auf multimodale Text- und Bildverarbeitung direkt auf Geräten ab.
- 2.Nutzt LFM2.5-2.6B mit einem SigLIP2 NaFlex Vision Encoder.
- 3.Meldet weniger als 3,3 GB Speicherbedarf für die Inferenz.
LiquidAI hat LFM2.5-VL-3B auf Hugging Face veröffentlicht, eine multimodale Variante seiner hybriden LFM2.5-Modellfamilie, die für den Einsatz direkt auf Geräten entwickelt wurde. Das Modell verarbeitet Text und Bilder, nutzt das Sprachmodell LFM2.5-2.6B als Backbone und kombiniert es mit einem SigLIP2 NaFlex 400M Vision Encoder. Zu den berichteten Fähigkeiten gehören verbessertes Grounding und Objekterkennung mit natürlichsprachlichen Abfragen, ganzseitige OCR mit Layout-Annotation sowie Inferenz mit weniger als 3,3 GB Speicherbedarf.
⚡ Heute ausprobieren
Prüfen Sie LFM2.5-VL-3B auf Hugging Face für lokale OCR-, Grounding- und Bild-Text-Aufgaben, bevor Sie sich für ein größeres Vision-Modell entscheiden.
Quellen & Originalberichte
Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.
Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.
Mehr in Modelle
Qwen3.8 27B erzielt 52 Punkte bei Artificial Analysis
Nutzer auf Reddit und Hacker News machten auf das Abschneiden des Modells bei Artificial Analysis und sein Agentic-Ranking aufmerksam.
Google bringt Gemini 3.7 Flash auf den Markt
Das neue Flash-Modell zielt auf Coding, Agenten und Workflow-Automatisierung zu Einführungspreisen.
Meta veröffentlicht Open-Weight-KI-Modell Glimmer
Das Modell lässt sich herunterladen und lokal ausführen, während Meta Muse Spark hinter APIs hält.