Cactus, 에지 기기용 Needle 2 공개
14MB 에이전트형 LLM이 휴대폰, 웨어러블, 로봇에서 도구 사용과 구조화된 추출을 겨냥한다.
왜 중요한가
Needle 2는 AI 에이전트를 PC, Mac, 클라우드 시스템에만 의존하지 않고 제약이 큰 에지 하드웨어에서 실행하려는 흐름이 계속되고 있음을 보여준다. 벤치마크 주장이 실제로 확인된다면, 초소형 모델은 저가 연결 기기 전반에서 도구 사용과 기기 제어를 더 실용적으로 만들 수 있다.
핵심 포인트
- 1.Needle 2는 세션당 28MB RAM을 사용하는 14MB 바이너리다.
- 2.Cactus는 Raspberry Pi 5에서 초당 500토큰 디코딩을 기록했다고 밝혔다.
- 3.이 모델은 도구 호출, 기기 사용, 구조화된 추출을 겨냥한다.
Cactus가 휴대폰, 웨어러블, 스마트홈 기기, 소형 로봇, 마이크로컨트롤러에서 도구 호출, 기기 사용, 구조화된 추출을 위해 설계한 14MB 에이전트형 LLM Needle 2를 공개했다. 회사에 따르면 이 모델은 2비트 압축 기준 4,500만 개 매개변수를 담은 단일 14MB 바이너리이며, 전체 세션을 28MB RAM에서 실행할 수 있다. Cactus는 Raspberry Pi 5에서 초당 500토큰, Meta Quest 3S와 Apple Vision Pro에서 초당 400~1,500토큰, 200달러 미만 Samsung A-Series 휴대폰에서 초당 300~700토큰의 디코딩 속도를 기록했다고 밝혔다.
⚡ 오늘 바로 활용
도구 호출 워크플로에 더 큰 모바일 또는 클라우드 모델을 채택하기 전에, 목표 에지 하드웨어에서 Needle 2를 먼저 평가하라.
출처 및 원본 보도
이 브리핑은 아래 매체의 보도를 요약하고 링크합니다.
이 브리핑이 유용했나요? 다음 소식을 메일로 받아보세요.
관련: 모델
Sentence Transformers, 멀티 벡터 검색 기능 추가
버전 6.0은 ColBERT 스타일의 late interaction 모델을 위한 MultiVectorEncoder를 도입했다.
Qwen3.8 27B, Artificial Analysis에서 52점 기록
Reddit과 Hacker News 사용자들이 이 모델의 Artificial Analysis 성과와 에이전틱 순위에 주목했다.
Google, 5개 축구 클럽과 Gemini·Pixel 파트너십 체결
이번 파트너십은 AI와 스마트폰 기능을 클럽 팬들의 경기일 경험에 접목하는 것을 목표로 한다.