Gemma 4 26BをRAM 2GBで動作させるOSSエンジン

원제: Show HN: Open-source engine running Gemma 4 26B in 2 GB RAM on any M-series Mac

왜 중요한가

대형 MoE 모델을 소비자용 저메모리 기기에서 로컬 실행 가능하게 함으로써 엣지 AI 추론의 실용화 가능성을 넓힌다。

개발자 drumih가 Apple Silicon Mac 전용 오픈소스 추론 엔진 「TurboFieldfare」를 GitHub에 공개した。Swift와 Metal로 구현され、26B 파라미터의 Gemma 4 26B-A4B 모델을 약 2GB RAM 환경에서 구동할 수 있る。8GB RAM 탑재 MacBook을 포함한 모든 M 시리즈 Mac을 지원する。

TurboFieldfare는 Google의 Gemma 4 26B-A4B(Mixture-of-Experts 모델)를 극히 적은 메모리로 실행하기 위해 설계된 커스텀 추론 런타임이다。통상 모델 전체를 메모리에 로드하면 14.3GB가 필요하지만、본 엔진은 공유 코어(1.35GB)와 FP16 KV 캐시만 메모리에 상주시키고、각 토큰 생성에 필요한 Expert 레이어만 SSD에서 스트리밍하는 방식을 채택했다。이를 통해 전체 메모리 사용량을 약 2GB로 억제한다。구현 언어는 Swift 및 Apple의 GPU 셰이더 언어 Metal을 사용하며、Apple Silicon의 통합 메모리 아키텍처를 최대한 활용하는 구조로 설계됐다。로컬 서버 모드도 지원하여 API 형태로도 이용 가능하다。소스 코드는 Apache-2.0 라이선스로 공개되어 있으며、GitHub에서 Star 574개를 기록하고 있다。저장소에는 벤치마크 결과 및 실험 데이터도 포함되어 있다。

출처

github.com — 원문 읽기 →