Cactus lance Needle 2 pour les appareils en périphérie
Ce LLM agentique de 14 Mo vise l’utilisation d’outils et l’extraction structurée sur téléphones, objets connectés et robots.
Pourquoi c'est important
Needle 2 illustre la poursuite des efforts pour faire tourner des agents IA sur du matériel edge contraint, plutôt que seulement sur PC, Mac ou systèmes cloud. Si ses performances annoncées se confirment, de très petits modèles pourraient rendre l’utilisation d’outils et le contrôle d’appareils plus pratiques sur un large éventail d’appareils connectés à bas coût.
Points clés
- 1.Needle 2 est un binaire de 14 Mo utilisant 28 Mo de RAM par session.
- 2.Cactus indique un décodage à 500 tokens/s sur Raspberry Pi 5.
- 3.Le modèle cible les appels d’outils, l’utilisation d’appareils et l’extraction structurée.
Cactus a lancé Needle 2, un LLM agentique de 14 Mo conçu pour l’appel d’outils, l’utilisation d’appareils et l’extraction structurée sur téléphones, objets connectés, équipements de maison intelligente, petits robots et microcontrôleurs. L’entreprise affirme que le modèle tient dans un binaire unique de 14 Mo, avec 45 millions de paramètres compressés en 2 bits, et qu’il peut exécuter une session complète avec 28 Mo de RAM. Elle indique des vitesses de décodage de 500 tokens par seconde sur Raspberry Pi 5, de 400 à 1 500 tokens par seconde sur Meta Quest 3S et Apple Vision Pro, et de 300 à 700 tokens par seconde sur des téléphones Samsung A-Series à moins de 200 dollars.
⚡ À tester aujourd'hui
Évaluez Needle 2 sur votre matériel edge cible avant d’opter pour des modèles mobiles ou cloud plus volumineux pour les workflows d’appel d’outils.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Modèles
LiquidAI publie des checkpoints Q4_0 pour LFM2.5
Les fichiers GGUF utilisent une distillation tenant compte de la quantification afin de limiter la perte de qualité dans les modèles LFM2.5 en 4 bits.
Les benchmarks de GLM-5.3 alimentent les discussions chez les développeurs
Les benchmarks d’Artificial Analysis pour GLM-5.3 ont circulé sur Hacker News et r/LocalLLaMA.
Qwen3.8 27B obtient un score de 52 sur Artificial Analysis
Des utilisateurs de Reddit et Hacker News ont relevé les résultats du modèle sur Artificial Analysis et son classement agentique.