AAI News Hub
ModèlesTue, August 11, 2026·Aug 112 sources corroborating

Cactus lance Needle 2 pour les appareils en périphérie

Ce LLM agentique de 14 Mo vise l’utilisation d’outils et l’extraction structurée sur téléphones, objets connectés et robots.

Pourquoi c'est important

Needle 2 illustre la poursuite des efforts pour faire tourner des agents IA sur du matériel edge contraint, plutôt que seulement sur PC, Mac ou systèmes cloud. Si ses performances annoncées se confirment, de très petits modèles pourraient rendre l’utilisation d’outils et le contrôle d’appareils plus pratiques sur un large éventail d’appareils connectés à bas coût.

Points clés

  • 1.Needle 2 est un binaire de 14 Mo utilisant 28 Mo de RAM par session.
  • 2.Cactus indique un décodage à 500 tokens/s sur Raspberry Pi 5.
  • 3.Le modèle cible les appels d’outils, l’utilisation d’appareils et l’extraction structurée.

Cactus a lancé Needle 2, un LLM agentique de 14 Mo conçu pour l’appel d’outils, l’utilisation d’appareils et l’extraction structurée sur téléphones, objets connectés, équipements de maison intelligente, petits robots et microcontrôleurs. L’entreprise affirme que le modèle tient dans un binaire unique de 14 Mo, avec 45 millions de paramètres compressés en 2 bits, et qu’il peut exécuter une session complète avec 28 Mo de RAM. Elle indique des vitesses de décodage de 500 tokens par seconde sur Raspberry Pi 5, de 400 à 1 500 tokens par seconde sur Meta Quest 3S et Apple Vision Pro, et de 300 à 700 tokens par seconde sur des téléphones Samsung A-Series à moins de 200 dollars.

À tester aujourd'hui

Évaluez Needle 2 sur votre matériel edge cible avant d’opter pour des modèles mobiles ou cloud plus volumineux pour les workflows d’appel d’outils.

Sources et articles originaux

Ce brief résume et renvoie vers la couverture des médias ci-dessous.

Ce brief vous a plu ? Recevez le prochain par e-mail.

Plus dans Modèles