DeepSeek V4 Flash tourne sur un seul AMD MI300X
Original : DeepSeek V4 Flash on a Single AMD MI300X
Pourquoi c'est important
Démontre la viabilité des GPU AMD MI300X pour des LLM de grande taille en production.
Un développeur a publié sur GitHub la configuration complète pour faire fonctionner DeepSeek-V4-Flash-0731 sur un unique GPU AMD MI300X en production, sans quantification supplémentaire. Le débit atteint 168,6 tok/s en flux unique et 830 tok/s pour 64 flux simultanés.
Le dépôt GitHub de ryanzhou documente comment exécuter le modèle DeepSeek-V4-Flash-0731 sur un seul GPU AMD MI300X en environnement de production. La stack repose sur vLLM ROCm nightly (0.26.1rc1.dev229) et AITER 0.1.19, avec un Docker Compose et des correctifs SHA-256 vérifiés. Les performances mesurées sont notables : 168,6 tok/s en décodage single-stream (médiane, DSpark-7), environ 7 900 à 8 500 tok/s en prefill avec les kernels optimisés, et 830 tok/s en agrégat pour 64 flux simultanés sans OOM. Le modèle charge 156,67 Gio de poids en HBM, sans quantification ni déchargement mémoire. La recette officielle de vLLM cible NVIDIA et les GPU AMD plus récents ; faire fonctionner le modèle sur MI300X a nécessité des correctifs spécifiques pour le format FP8, le routage MoE à haute concurrence, la vérification spéculative causale, la synchronisation CPU-KV et plusieurs formes de kernels non optimisées. Le contexte de 256 000 tokens est validé, l'architecture supportant jusqu'à 1 million.