Qwen 3.8 27B disponible sur Cerebras à 1500 tokens/s
Original : Qwen 3.8 27B available on Cerebras at 1500 tokens/s
Pourquoi c'est important
L'accès public à des LLM rapides favorise l'adoption de l'IA dans les applications temps réel.
Cerebras Inference propose désormais le modèle open-source Qwen 3.8 27B sur ses endpoints publics, avec une vitesse d'inférence annoncée à environ 1500 tokens par seconde et une fenêtre de contexte allant jusqu'à 128 000 tokens pour les abonnés payants.
La plateforme Cerebras Inference a ajouté le modèle Qwen 3.8 27B (identifiant : qwen-3.8-27b, 27 milliards de paramètres) à son catalogue public, aux côtés du modèle OpenAI GPT OSS 120B. Le modèle Qwen 3.8 27B offre une vitesse d'environ 1500 tokens/s, une fenêtre de contexte de 64 000 tokens en version gratuite et 128 000 tokens en version payante. Le modèle 120B, quant à lui, atteint ~3000 tokens/s avec un contexte maximal de 131 000 tokens. Cerebras précise que tous les modèles hébergés sur ses endpoints publics sont des versions originales, non élagage (unpruned). La plateforme utilise une quantification sélective des poids uniquement lors du stockage (formats 16-bit/8-bit/4-bit), tandis que les activations, l'attention et le cache KV restent en pleine précision. Les modèles élagués issus de la recherche interne (technique REAP) sont disponibles sur Hugging Face, mais ne sont pas accessibles via l'API de production.