Needle 2 : un LLM agentique de 14 Mo pour appareils embarqués
Original : Show HN: Needle2: 14MB agentic LLM for phones, wearables, smart home and robots
Pourquoi c'est important
Permet d'embarquer l'IA agentique sur les 21 milliards d'appareils IoT à bas coût.
Cactus Compute lance Needle 2, un modèle de langage open source de 45 millions de paramètres tenant dans 14 Mo. Il tourne dans 28 Mo de RAM, atteint 500 tokens/sec sur Raspberry Pi 5, et cible les objets connectés, téléphones à moins de 200 $, wearables et robots.
Cactus Compute publie Needle 2, un modèle LLM agentique de 45 millions de paramètres compressé en CQ2-bit, distribué sous forme d'un unique binaire de 14 Mo. Il consomme au maximum 28 Mo de RAM par session, ce qui le rend compatible avec des microcontrôleurs récents comme l'ESP32-S3. Sur Raspberry Pi 5, il atteint 500 tokens/sec en décodage et plus de 800 en prefill. Sur des appareils VR comme le Meta Quest 3S ou l'Apple Vision Pro, il tourne entre 400 et 1 500 tokens/sec, et entre 300 et 700 sur des smartphones à moins de 200 $.
Le modèle est conçu pour le tool calling, le contrôle d'appareil et l'extraction structurée. Selon Cactus, il rivalise sur les benchmarks Mobile-Actions et device use avec des modèles bien plus grands — FunctionGemma 270M, LFM2.5 230M et Apple FM — tout en étant 5 à 70 fois plus petit. La logique repose sur le fait que des tâches comme allumer une lumière ou remplir un formulaire ne nécessitent pas de connaissances encyclopédiques, mais uniquement de mapper une phrase sur des fonctions typées.
Needle 2 inclut un score de confiance par réponse et retourne un appel vide pour les requêtes hors sujet, afin de faciliter la collaboration edge-cloud. Il est disponible sous licence Apache 2.0, avec les poids sur Hugging Face.