Gemma 4 26B, seulement 2 Go de RAM sur Mac Apple Silicon

Original : Show HN: Open-source engine running Gemma 4 26B in 2 GB RAM on any M-series Mac

Pourquoi c'est important

Démocratise l'inférence de grands modèles LLM sur hardware grand public à mémoire limitée.

TurboFieldfare, un moteur open-source en Swift + Metal, permet d'exécuter le modèle Gemma 4 26B-A4B de Google sur n'importe quel Mac Apple Silicon avec seulement ~2 Go de RAM, contre 14,3 Go normalement requis pour charger le modèle complet.

Le projet open-source TurboFieldfare, publié sur GitHub par drumih, propose un runtime personnalisé écrit en Swift et Metal permettant d'exécuter le modèle Gemma 4 26B-A4B — un modèle d'instruction de 26 milliards de paramètres — avec une empreinte mémoire d'environ 2 Go seulement. Normalement, ce modèle nécessite de charger 14,3 Go en RAM. La technique repose sur une architecture MoE (Mixture of Experts) : le cœur partagé (1,35 Go) et le cache KV en FP16 restent en mémoire, tandis que seuls les experts nécessaires à chaque token sont streamés depuis le SSD à la demande. Cela rend le modèle utilisable même sur les MacBook équipés de 8 Go de RAM unifiée. Le projet est distribué sous licence Apache 2.0, compte déjà 574 étoiles et 18 forks sur GitHub, et inclut un serveur local, des benchmarks et une documentation pour contribuer des résultats.

Source

github.com — Lire l'original →