llama.cpp : l'IA open-source 100% locale sur votre machine
Original : llama.cpp
Pourquoi c'est important
llama.cpp centralise l'accès aux modèles open-source majeurs sur matériel grand public et professionnel.
llama.cpp, projet open-source avec 123 500 étoiles sur GitHub, permet d'exécuter des modèles d'IA de pointe directement sur sa machine, sans clé API ni télémétrie. Compatible avec Apple Silicon, NVIDIA, AMD, Intel et CPU, il supporte Qwen 3, Gemma 4, GPT-OSS et plus encore.
llama.cpp est un moteur d'inférence open-source permettant d'exécuter localement des modèles de langage avancés, sans recourir à des services cloud. Le projet, fort de 123 500 étoiles sur GitHub, propose une installation simple via une commande curl, Homebrew ou Winget, ainsi qu'une compilation depuis les sources. Il est optimisé pour un large éventail de matériels : Apple Silicon (M Pro, M Max, M Ultra), GPU NVIDIA (RTX 3090 à 5090, A100, H100), AMD (MI300, Radeon RX), Intel Arc, ainsi que les CPU standard et les cartes Jetson. La commande `llama serve` expose une API locale compatible avec des outils comme Pi, l'agent de code de HuggingFace, via le plugin `pi-llama`, sans aucune configuration réseau. Les modèles supportés incluent Qwen 3 d'Alibaba (dense et MoE, multimodal), Gemma 4 et Gemma 3 de Google (140+ langues, contexte 128K), ainsi que GPT-OSS, les premiers modèles open-weight d'OpenAI depuis GPT-2, orientés raisonnement et appels d'outils. Toutes les données et conversations restent sur la machine de l'utilisateur.