Cactus 发布面向边缘设备的 Needle 2
这款 14MB 的智能体 LLM 面向手机、可穿戴设备和机器人上的工具使用与结构化提取场景。
为什么重要
Needle 2 体现了业界持续推动 AI 智能体在受限边缘硬件上运行的努力,而不只是依赖 PC、Mac 或云端系统。如果其基准测试说法成立,超小型模型可能会让工具使用和设备控制在低成本联网设备上变得更实用。
核心要点
- 1.Needle 2 是一个 14MB 的二进制文件,每个会话使用 28MB RAM。
- 2.Cactus 报告称,其在 Raspberry Pi 5 上的解码速度为每秒 500 个 token。
- 3.该模型面向工具调用、设备使用和结构化提取场景。
Cactus 发布了 Needle 2,这是一款 14MB 的智能体 LLM,专为手机、可穿戴设备、智能家居设备、小型机器人和微控制器上的工具调用、设备使用和结构化提取而设计。该公司表示,该模型是一个 14MB 的单一二进制文件,采用 2-bit 压缩后拥有 4500 万参数,并可在 28MB RAM 中运行完整会话。Cactus 报告称,其在 Raspberry Pi 5 上的解码速度为每秒 500 个 token,在 Meta Quest 3S 和 Apple Vision Pro 上为每秒 400-1,500 个 token,在售价低于 200 美元的 Samsung A-Series 手机上为每秒 300-700 个 token。
⚡ 今天就能用
在为工具调用工作流采用更大的移动端或云端模型之前,应先在你的目标边缘硬件上评估 Needle 2。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
觉得这篇简报有用?下一篇直接送到你的邮箱。
更多 模型
模型
GLM-5.3 基准测试引发开发者讨论
Artificial Analysis 关于 GLM-5.3 的基准测试在 Hacker News 和 r/LocalLLaMA 上流传。
Hacker News+1 家媒体·11h ago
模型
Qwen3.8 27B 在 Artificial Analysis 上获得 52 分
Reddit 和 Hacker News 用户注意到该模型在 Artificial Analysis 上的表现及其智能体排名。
r/LocalLLaMA+1 家媒体·1d ago
模型
《Your AI Slop Bores Me》让真人扮演聊天机器人
这款网页游戏让用户手动回答提示词,通过扮演 AI 一方来赚取积分。
The Verge AI·3d ago