Qwen 3 125B tourne sur RTX 4090 à 100 tokens/s
Original : Run Qwen 3.8 Flash Next (125B) on consumer hardware (RTX 4090) at 100T/s
Pourquoi c'est important
L'inférence de LLM 125B sur GPU grand public change l'accès à l'IA locale.
Strata, moteur d'inférence open source, permet de faire tourner Qwen3.8-Flash-Next (125 milliards de paramètres) sur un GPU grand public RTX 4090, avec 100 tokens/s, via une API compatible OpenAI/Anthropic en local.
Strata est un moteur d'inférence open source publié sur GitHub par Niko1221, qui atteint déjà 10 200 étoiles et 906 forks. Il permet d'exécuter Qwen3.8-Flash-Next, un modèle de 125 milliards de paramètres développé par Alibaba, sur du matériel grand public — à partir de 12 Go de VRAM, sous Windows ou Linux. Le projet affiche 100 tokens par seconde sur une RTX 4090.
L'installation se fait en un clic via des scripts SETUP.bat (Windows) ou setup.sh (Linux). Strata expose une API locale compatible avec les standards OpenAI et Anthropic, ce qui facilite l'intégration dans des outils existants. La prise en charge des images en entrée est optionnelle. Le projet intègre ggml comme backend bas niveau et supporte également SYCL pour les GPU Intel. Un contexte de 128 000 tokens est disponible, avec quantification IQ3_S pour réduire l'empreinte mémoire. Des fichiers de benchmark sont présents dans le dépôt pour valider les performances selon la configuration matérielle.