Fermion Research、軽量LLM「Neutrino-1 8B」を公開

Judul asli: Neutrino-1 8B

Mengapa Ini Penting

独自圧縮フォーマットによる高速推論と省メモリ化が、エッジ環境でのLLM実用展開を広げる可能性を示す。

Fermion Researchは2026年7月27日、8.19Bパラメータのデコーダー専用トランスフォーマー「Neutrino-1 8B」をリリース。ファイルサイズ3.88GB、H100で763トークン/秒を実現。

Fermion Researchは、独自の三値(ternary-family)重みフォーマットを採用した大規模言語モデル「Neutrino-1 8B」を公開した。パラメータ数は8.19Bで、252個のTransformerの線形層をfp16の8分の1のサイズで格納する。重みはビットパック状態で保持され、行列演算カーネル内でデコードされるため、デコードパスにfp16やfp32の重みデータを保持しない。

ダウンロードサイズは2.56GB(ロスレス)、コンテナ全体は3.88GBで、8GB GPUや16GBラップトップでも動作可能。同一のコンテナファイルがデータセンターGPU、MacBook、デスクトップCPUを変換なしにサポートする。

ベースモデルはAlibaba CloudのQwen3-8B(Apache-2.0ライセンス)。アーキテクチャはグループクエリアテンション(4:1)、隠れ層幅4,096、フィードフォワード幅12,288(SwiGLU)、コンテキスト長40,960トークン。MMLUスコアは72.1、H100でのSpeculative Decodeでは763トークン/秒を達成した。コード化された重みのうち62.63%はゼロ値であり、残りは正負ほぼ均等に分布している。

Sumber

fermionresearch.com — Baca artikel asli →