DwarfStar 4: Jalankan LLM 284B secara lokal

Judul asli: From the creator of Redis; run LLM locally with ds4

Mengapa Ini Penting

Membuktikan model 284B bisa dijalankan lokal tanpa infrastruktur cloud besar.

DwarfStar 4 (ds4), inference engine berbasis C dari kreator Redis, mampu menjalankan DeepSeek V4/V4.1, GLM 5.x, dan Qwen3.8 secara lokal di Mac, CUDA, dan ROCm.

DwarfStar 4 (ds4) adalah inference engine sempit berbasis C yang dirancang khusus untuk menjalankan model open-weights frontier secara lokal di mesin berkapasitas memori tinggi. Proyek ini dibuat oleh Salvatore Sanfilippo, kreator Redis, dan kini tersedia di GitHub dengan lisensi MIT.

Ds4 mendukung DeepSeek V4 dan V4.1 Flash (284 miliar parameter, mixture-of-experts), GLM 5.x, serta Qwen3.8 Flash. Model sebesar itu biasanya hanya bisa dijalankan secara remote, tapi ds4 membalik asumsi itu lewat tiga pendekatan utama.

Pertama, kuantisasi 2-bit asimetrik: routed experts dikompresi agresif, sementara jalur shared yang kritis tetap presisi. Kedua, KV cache berbasis disk — prefiks panjang disimpan ke SSD dan dipanggil ulang lewat hash SHA1 prompt, sehingga restart tidak memerlukan full re-prefill. Ketiga, satu engine dengan tiga antarmuka: CLI interaktif (./ds4), server API kompatibel OpenAI/Anthropic (./ds4-server), dan agen coding (./ds4-agent).

Target hardware mencakup Apple Silicon Mac 64 GB ke atas (Metal), NVIDIA DGX Spark atau mesin CUDA Linux, AMD Strix Halo (ROCm), hingga Mac Studio 512 GB untuk varian V4.1 Q4.

Sumber

dwarfstar.sh — Baca artikel asli →