Model 125B bisa jalan di RTX 4090 via Strata
Judul asli: Run Qwen 3.8 Flash Next (125B) on consumer hardware (RTX 4090) at 100T/s
Mengapa Ini Penting
Inferensi model 125B di GPU konsumer memperluas akses AI tanpa infrastruktur cloud.
Strata, proyek open-source di GitHub, memungkinkan model AI 125 miliar parameter Qwen3.8-Flash-Next berjalan di GPU konsumer RTX 4090 dengan kecepatan 100 token per detik.
Strata adalah inference engine open-source buatan Niko1221 yang dirancang agar model Qwen3.8-Flash-Next — berukuran 125 miliar parameter — dapat dijalankan di PC gaming biasa. GPU yang didukung adalah NVIDIA maupun AMD dengan VRAM minimal 12 GB, di sistem operasi Windows atau Linux. Instalasi diklaim satu klik lewat skrip SETUP.bat atau setup.sh. Engine ini menyediakan API lokal yang kompatibel dengan format OpenAI dan Anthropic, sehingga bisa dipakai langsung oleh aplikasi yang sudah ada. Strata juga mendukung input gambar dan context window hingga 128K token. Proyek ini meraih lebih dari 10.200 bintang dan 906 fork di GitHub, menandakan adopsi komunitas yang cepat. Dalam demo, model berjalan di RTX 5070 dengan kuantisasi IQ3_S menghasilkan respons visual seperti taman pagoda voxel dari satu prompt.