Kolibri : le LLM souverain d'Aleph Alpha décrypté

Original : Aleph Alpha Kolibri: How the sovereign German LLM works

Pourquoi c'est important

Kolibri pose un jalon concret pour l'IA souveraine européenne conforme à l'EU AI Act.

Aleph Alpha a lancé Kolibri le 3 octobre 2026, un LLM open-weight de 78,1 milliards de paramètres, mixture-of-experts, bilingue allemand/anglais, sous licence Apache 2.0, entraîné sur 24 billions de tokens en Europe.

Kolibri est le nouveau modèle de langage d'Aleph Alpha, conçu explicitement dans le cadre de l'EU AI Act. Architecture mixture-of-experts (MoE) : 78,1 milliards de paramètres au total, mais seulement 3,46 milliards activés par token, ce qui allège considérablement l'inférence. Le contexte natif atteint 262 144 tokens, testé jusqu'à 1 048 576. Entraîné sur 768 GPU NVIDIA B200 en Allemagne et en Finlande, le modèle a ingéré environ 24 billions de tokens — dont plus d'un cinquième en allemand. Les poids sont disponibles sur Hugging Face. La date de coupure des connaissances est fixée au 18 juin 2026.

Le mot « souverain » a ici un sens précis : le modèle a été construit et entraîné sous droit européen et allemand, sans contrôle étranger. Une organisation peut le déployer sur ses propres serveurs, sans que ses données quittent le périmètre. Aleph Alpha a également signé le code de conduite GPAI de l'Union européenne.

Nuance importante : la souveraineté n'est pas absolue. Le rapport technique de 189 pages indique que des modèles externes ont été utilisés dans le pipeline de préparation des données — Gemma 4 (Google) pour reformuler des textes web en anglais, Mistral-NeMo pour l'allemand, et Qwen3-32B pour labelliser des données de qualité. Aleph Alpha affirme avoir filtré les biais politiques potentiels introduits par ces modèles.

Source

tej.as — Lire l'original →