AAI News Hub
ModelosTue, August 11, 2026·Aug 112 sources corroborating

Cactus lança o Needle 2 para dispositivos de borda

O LLM agêntico de 14 MB mira uso de ferramentas e extração estruturada em celulares, wearables e robôs.

Por que importa

O Needle 2 reflete o trabalho contínuo para rodar agentes de IA em hardware de borda com recursos limitados, em vez de apenas em PCs, Macs ou sistemas em nuvem. Se suas alegações de benchmark se confirmarem, modelos muito pequenos poderão tornar o uso de ferramentas e o controle de dispositivos mais viáveis em uma ampla gama de aparelhos conectados de baixo custo.

Pontos-chave

  • 1.O Needle 2 é um binário de 14 MB que usa 28 MB de RAM por sessão.
  • 2.A Cactus relata decodificação de 500 tokens/s no Raspberry Pi 5.
  • 3.O modelo mira chamadas de ferramentas, uso em dispositivos e extração estruturada.

A Cactus lançou o Needle 2, um LLM agêntico de 14 MB projetado para chamadas de ferramentas, uso em dispositivos e extração estruturada em celulares, wearables, aparelhos de casa inteligente, pequenos robôs e microcontroladores. A empresa afirma que o modelo é um único binário de 14 MB, com 45 milhões de parâmetros em compressão de 2 bits, e consegue rodar uma sessão completa em 28 MB de RAM. Ela relata velocidades de decodificação de 500 tokens por segundo em um Raspberry Pi 5, de 400 a 1.500 tokens por segundo no Meta Quest 3S e no Apple Vision Pro, e de 300 a 700 tokens por segundo em celulares Samsung A-Series abaixo de US$ 200.

Experimente hoje

Avalie o Needle 2 no seu hardware de borda-alvo antes de optar por modelos móveis maiores ou modelos em nuvem para fluxos de trabalho com chamadas de ferramentas.

Fontes e reportagens originais

Este resumo sintetiza e linka a cobertura dos veículos abaixo.

Gostou deste resumo? Receba o próximo no seu e-mail.

Mais em Modelos