Fermion Research, 8B파라미터 경량 LLM 'Neutrino-1 8B' 공개

원제: Neutrino-1 8B

왜 중요한가

단일 파일로 데이터센터부터 엣지 디바이스까지 지원하는 초경량 LLM 포맷은 모델 배포 비용 구조와 엣지 AI 활용 가능성을 크게 바꿀 수 있다.

Fermion Research는 2026년 7월 27일, 8.19B 파라미터의 디코더 전용 트랜스포머 모델 'Neutrino-1 8B'를 공개했다. 독자적인 3진수 계열 가중치 포맷을 채용해 fp16 대비 1/8 용량인 3.88GB 단일 파일로 배포되며, H100에서 스펙 디코드 시 763 tok/s, MMLU 72.1점을 달성했다.

Neutrino-1 8Bは、Fermion Researchが開発した8.19Bパラメータの——이하 한국어로 작성합니다.

Neutrino-1 8B는 Fermion Research가 개발한 8.19B 파라미터 디코더 전용 트랜스포머 모델로, 베이스 모델은 Alibaba Cloud의 Qwen3-8B를 기반으로 하며 Apache-2.0 라이선스로 제공된다.

가장 큰 특징은 독자적인 '3진수 계열(ternary-family)' 가중치 포맷이다. 252개의 트랜스포머 선형 레이어에 적용되어 fp16 대비 1/8 크기인 3.88GB 단일 파일로 배포된다. 가중치는 비트팩 상태로 유지되고 행렬 연산 커널 내에서 디코딩되기 때문에, 디코드 경로에서 fp16 또는 fp32 형식의 가중치 데이터가 메모리에 저장되지 않는다.

아키텍처는 36개의 디코더 레이어, 히든 폭 4,096, SwiGLU 기반 FFN(폭 12,288), 그룹 쿼리 어텐션(4:1, 32 쿼리 헤드·8 KV 헤드)으로 구성된다. 컨텍스트 길이는 최대 40,960 토큰이며, 어휘 크기는 151,936이다. KV 캐시는 4k 컨텍스트 기준 1.21GB, 32k 기준 9.66GB이다.

전체 모델이 3.88GB이므로 8GB GPU 또는 16GB 메모리 탑재 노트북에서도 KV 캐시와 함께 동작 가능하다. 단일 컨테이너 파일로 데이터센터 GPU(H100), MacBook, 데스크탑 CPU 등 다양한 플랫폼을 변환 없이 지원하는 것이 특징이다.

코딩된 가중치 6.95B 중 62.63%가 0이며, 나머지는 양수 18.68%, 음수 18.69%로 균형을 이룬다. 성능 지표로는 MMLU 72.1점, H100에서의 스펙 디코드 763 tok/s가 공개됐으며, 다운로드 크기는 2.56GB다.

출처

fermionresearch.com — 원문 읽기 →