RTX 4090로 125B 모델 100T/s 구동

원제: Run Qwen 3.8 Flash Next (125B) on consumer hardware (RTX 4090) at 100T/s

왜 중요한가

125B급 모델의 로컬 구동 문턱을 소비자 GPU 수준으로 낮춤으로써 클라우드 API 의존도를 줄이는 흐름을 가속할 수 있다.

오픈소스 프로젝트 Strata가 125B 파라미터 규모의 Qwen3.8-Flash-Next 모델을 RTX 4090 등 소비자용 GPU(VRAM 12GB 이상)에서 초당 100토큰 속도로 실행할 수 있는 원클릭 설치 엔진을 GitHub에 공개했다. Windows·Linux를 지원하며 OpenAI/Anthropic 호환 로컬 API와 이미지 입력 기능도 제공한다.

Niko1221이 공개한 Strata는 통상 서버급 인프라가 필요한 125B 파라미터 모델 Qwen3.8-Flash-Next를 일반 게이밍 PC에서 구동하기 위한 추론 엔진이다. NVIDIA·AMD GPU 모두 지원하며, 최소 VRAM 요건은 12GB다. GitHub 저장소는 공개 이후 별 10,200개, 포크 906개를 기록하고 있다.

성능 측면에서 RTX 5070 기준 IQ3_S 양자화·128K 컨텍스트 조건으로 바둑 정원 복셀 이미지를 단일 프롬프트로 생성하는 49초 분량의 데모 영상이 공개됐다. 설치는 Windows용 SETUP.bat, Linux용 setup.sh 스크립트로 원클릭 처리되며, 업데이트·실행도 별도 배치 파일로 분리돼 있다.

Strata는 로컬호스트에서 OpenAI 및 Anthropic API 형식을 그대로 지원해 기존 클라이언트 도구와의 호환성을 확보했다. 텍스트 추론 외 이미지 입력(멀티모달)도 선택적으로 활성화할 수 있다. 백엔드는 ggml 기반이며, SYCL 경로도 포함돼 Intel GPU 지원 가능성도 열어 두고 있다. 라이선스는 MIT다.

현재 이슈 72건, PR 162건이 열려 있어 커뮤니티 기여가 활발하게 이뤄지는 초기 개발 단계임을 보여 준다.

출처

github.com — 원문 읽기 →