MicroLLM Lab : 7 petits LLM testables dans le navigateur
Original : MicroLLM Lab – Try 7 tiny LLM's in the browser
Pourquoi c'est important
L'inférence LLM gratuite sur GPU client remet en question le modèle économique des API cloud.
MicroLLM Lab est un outil en ligne permettant de charger, tester et comparer 7 Small Language Models (25M–360M paramètres) directement dans le navigateur via WebGPU, sans serveur, sans compte, et avec une latence inférieure à 10 ms pour le premier token.
MicroLLM Lab, publié sur stateofutopia.com, propose un environnement expérimental pour exécuter des modèles de langage compacts entièrement côté client. Les modèles, quantifiés en Q4 (4 bits par paramètre), occupent entre 50 et 84 Mo de mémoire et s'appuient sur WebGPU — la norme W3C qui accède directement au GPU via Metal, DirectX 12 ou Vulkan. Aucune donnée ne quitte l'appareil : les poids sont mis en cache dans l'IndexedDB du navigateur.
L'outil se destine à trois usages principaux : le chat on-device, le benchmarking automatisé (vitesse soutenue sur 256 tokens, précision sur des tests objectifs par regex), et la comparaison entre modèles avec génération d'un certificat de performance partageable sur X ou LinkedIn. Une interface d'évaluation personnalisée en JavaScript permet également d'écrire ses propres tests. L'objectif affiché est de démontrer l'intérêt des SLM comme couche de triage rapide avant de faire appel à des modèles cloud coûteux comme GPT-4 ou Claude.