Fermion Research lance Neutrino-1 8B, LLM ultra-compact

Original : Neutrino-1 8B

Pourquoi c'est important

Ce format ternaire compact redéfinit les seuils matériels pour déployer des LLM 8B en production.

Fermion Research a publié le 27 juillet 2026 Neutrino-1 8B, un modèle de langage de 8,19 milliards de paramètres tenant dans un fichier unique de 3,88 Go grâce à un format de poids ternaire propriétaire, 8× plus compact que le fp16. Il atteint 763 tokens/s sur H100 et score 72,1 sur MMLU.

Neutrino-1 8B est un transformer decoder-only de 8,19 milliards de paramètres développé par Fermion Research, dérivé du modèle de base Qwen3-8B d'Alibaba Cloud (licence Apache-2.0). Sa caractéristique principale est un format de poids ternaire propriétaire appliqué aux 252 linéaires du transformer : 62,63 % des poids codés sont à zéro, et le reste se répartit symétriquement entre valeurs positives (18,68 %) et négatives (18,69 %). Ce format réduit le fichier à 3,88 Go contre ~16 Go en fp16 standard, permettant au modèle de s'exécuter sur un GPU de 8 Go, un MacBook 16 Go ou un CPU de bureau sans conversion de fichier. L'architecture intègre 36 couches decoder, une largeur cachée de 4 096, une attention grouped-query (32 têtes query, 8 KV), un contexte de 40 960 tokens et un vocabulaire de 151 936 entrées. Le cache KV en fp32 occupe 1,21 Go pour 4k tokens. Le décodage spéculatif sur H100 atteint 763 tokens/s. Le modèle sera disponible à partir du 27 juillet 2026.

Source

fermionresearch.com — Lire l'original →