Kimi K3、AMD MI355XでB300より優れたコスパを実現
원제: Running Kimi K3 on MI355X at Better Performance per Dollar Than B300
왜 중요한가
대형 오픈소스 모델의 거대화에 따라 고용량 HBM을 탑재한 AMD GPU의 실용적 우위가 구체적인 수치로 입증되었으며, 추론 인프라 선택의 다양화가 가속될 가능성이 있다.
AI인프라 스타트업 Wafer는 2026년 7월 31일, AMD MI355X 1노드(8GPU)에서 Kimi K3(2.8조 파라미터)를 구동해 952 tok/s/node의 처리량을 달성했다고 발표했다. GPU당 시간당 비용 기준 성능은 48 tok/s/$로, B300의 33 tok/s/$, B200의 7 tok/s/$를 크게 상회した。
Wafer가 공개한 벤치마크에 따르면, Moonshot AI의 오픈소스 모델 Kimi K3는 2.8조 파라미터 규모로, 1M 토큰 KV 캐시 포함 시 1.5TB 이상의 VRAM이 필요하다. 이 때문에 8×192GB VRAM의 B200 단일 노드로는 구동이 불가능하며, NVIDIA B300(288GB/GPU) 또는 AMD MI355X(288GB/GPU) 노드가 요구된다.
1,024 토큰 입력·400 토큰 출력 기준 벤치마크에서 MI355X(TP8, 8GPU)는 최대 집계 처리량 952 tok/s, 단일 스트림 118 tok/s를 기록했다. 반면 B200 TP16(2노드 16GPU)은 498 tok/s, B300(TP8+DCP8)은 1,568 tok/s였다. B300은 절대 처리량에서 MI355X의 약 1.65배이지만, GPU당 시간당 가격이 MI355X($2.50) 대비 약 2.4배($6.00)에 달해 비용 대비 성능에서는 MI355X가 우위를 점했다.
Wafer는 구현 과정에서 ROCm 환경에서 Speculative Decoding(투기적 디코딩) 적용 시 `top_k_renorm_prob` 함수 미정의 오류가 발생하는 문제를 확인하고 직접 수정했다. AMD는 Kimi K3에 대해 Day-0 소프트웨어 지원을 제공했으며, 이를 통해 엔지니어링 부담이 크게 줄었다고 Wafer는 밝혔다. B200은 2노드 간 크로스노드 all-reduce(RoCE v2, 약 195 Gb/s)가 발생해 디코드 성능이 다소 저하된다는 점도 지적됐다.