LLM 28,9M paramètres sur microcontrôleur à 8$

Original : Running a 28.9M parameter LLM on an $8 microcontroller

Pourquoi c'est important

Ouvre la voie à l'IA embarquée ultra-low-cost sans dépendance cloud.

Un développeur a fait fonctionner un modèle de langage de 28,9 millions de paramètres sur un microcontrôleur ESP32-S3 à environ 8$, sans connexion serveur. Le modèle génère du texte à 9 tokens/seconde sur un petit écran, stockant 25M paramètres dans la mémoire flash.

Le projet open source esp32-ai, publié sur GitHub par slvDev, démontre qu'un LLM de 28,9 millions de paramètres peut tourner entièrement en local sur un ESP32-S3, microcontrôleur grand public coûtant environ 8 dollars. La puce dispose de 512 Ko de SRAM, 8 Mo de PSRAM et 16 Mo de mémoire flash. La clé de cette prouesse technique réside dans l'utilisation des Per-Layer Embeddings, une technique issue des modèles Gemma de Google, qui permet de stocker 25 millions des 28,9 millions de paramètres directement dans la mémoire flash plutôt qu'en RAM. Le modèle génère du texte à environ 9 tokens par seconde, affiché sur un petit écran connecté à la puce. Aucune donnée n'est envoyée vers un serveur externe. À titre de comparaison, le précédent record sur ce type de puce était un modèle de seulement 260 000 paramètres — soit environ 100 fois moins. Le projet compte déjà 914 étoiles et 100 forks sur GitHub.

Source

github.com — Lire l'original →