DeepSeek V4 Flash를 단일 AMD MI300X에서 실행

원제: DeepSeek V4 Flash on a Single AMD MI300X

왜 중요한가

대형 MoE 모델을 단일 AMD GPU에서 양자화 없이 프로덕션 운용한 사례로 AMD 기반 LLM 추론 생태계 확장에 기여한다。

개발자 ryanzhou가 AMD MI300X GPU 1장으로 DeepSeek-V4-Flash-0731 모델을 프로덕션 환경에서 실행하는 구성 및 패치를 GitHub에 공개했다。단일 스트림 디코드 속도는 중앙값 168.6 tok/s、8개 동시 스트림에서는 합산 542 tok/s를 달성했으며、256K 컨텍스트를 검증했다。

ryanzhou는 DeepSeek-AI의 DeepSeek-V4-Flash-0731 모델을 AMD MI300X GPU 단 1장으로 구동하기 위한 Docker Compose 스택、SHA-256 고정 파일 오버레이、업스트림 대비 참조 diff、튜닝 테이블을 GitHub에 공개했다。

핵심 성능 지표는 다음과 같다: 단일 스트림 디코드 중앙값 168.6 tok/s、튜닝된 커널을 사용한 프리필 약 7,900~8,500 tok/s、8개 동시 스트림 합산 542 tok/s(스트림당 중앙값 90.3 tok/s)、64스트림 버스트에서 합산 830 tok/s 달성(OOM 및 엔진 오류 없음)。가중치는 HBM 156.67 GiB를 사용하며 추가적인 양자화나 오프로드 없이 동작한다。256K 컨텍스트가 검증됐으며 아키텍처상 1M까지 지원된다。

공식 vLLM 레시피는 NVIDIA 및 신형 AMD 하드웨어를 대상으로 하기 때문에 MI300X에서 안정적으로 실행하려면 FP8 포맷、고동시성 MoE 라우팅、인과적 추측 검증(causal speculative verification)、CPU-KV 동기화、미조정 커널 형상 등 여러 문제에 대한 수정이 필요했다。사용된 스택은 vLLM ROCm 나이틀리 0.26.1rc1.dev229+g124154a88.rocm723과 AITER 0.1.19이다。

출처

github.com — 원문 읽기 →