Redis 창시자, 로컬 LLM 엔진 ds4 공개

원제: From the creator of Redis; run LLM locally with ds4

왜 중요한가

클라우드 없이 프론티어급 MoE 모델을 로컬에서 실행하는 실용적 경로를 제시해, 엣지·온프레미스 AI 인프라 논의를 구체화한다.

Redis 개발자 Salvatore Sanfilippo(antirez)가 2025년, 284억 파라미터 규모의 DeepSeek V4/V4.1, GLM 5.x, Qwen3.8을 고용량 Mac·CUDA·ROCm 머신에서 로컬로 실행하는 C 언어 기반 추론 엔진 DwarfStar 4(ds4)를 MIT 라이선스로 오픈소스 공개했다.

ds4는 범용 GGUF 러너가 아니다. 특정 모델 패밀리만 지원하고, 각 레이아웃을 끝까지 검증하는 '좁고 깊은' 설계를 택했다.

핵심 기술은 세 가지다. 첫째, 비대칭 2비트 양자화(Asymmetric 2-bit quantization)로 라우팅 전문가(routed experts)를 압축하면서 공유 경로는 정밀도를 유지한다. 덕분에 284B 규모의 혼합 전문가(MoE) 모델이 64GB 이상 Apple Silicon Mac에서도 동작한다. 둘째, KV 캐시를 SSD에 저장해 프롬프트 해시(SHA1)로 재활용한다. 서버 재시작 후에도 긴 프리픽스를 다시 계산하지 않아도 된다. 셋째, ./ds4(CLI), ./ds4-server(OpenAI·Anthropic 호환 로컬 API), ./ds4-agent(코딩 에이전트) 세 인터페이스가 동일한 모델 상태와 캐시를 공유한다.

지원 하드웨어는 Apple Silicon Mac(64GB 이상), NVIDIA DGX Spark 및 일반 CUDA Linux 박스, AMD Strix Halo(ROCm), Mac Studio(512GB, V4.1 Q4)다. 설치는 저장소 클론 → 모델 다운로드 → 백엔드별 빌드(macOS는 make, Linux DGX는 make cuda-spark) 세 단계로 완료된다. GitHub 스타는 공개 시점 기준 1만9천 개를 넘었다.

출처

dwarfstar.sh — 원문 읽기 →