Kog : optimiser l'inférence GPU par logiciel

Original : Kog is going deeper to squeeze more inference out of GPUs

Pourquoi c'est important

L'optimisation logicielle GPU représente une alternative crédible aux puces IA dédiées pour réduire les coûts d'inférence.

La startup française Kog affirme pouvoir accélérer l'inférence LLM jusqu'à 30x sur des GPU standard existants (AMD MI300X, Nvidia H200) grâce à son moteur logiciel KIE, sans matériel dédié. Elle a généré 200 leads après une démo sur Hacker News en mai 2026.

Fondée par Gaël Delalleau, la startup française Kog parie sur l'optimisation logicielle pour extraire davantage de puissance des GPU conventionnels, à rebours de l'engouement pour les puces dédiées à l'inférence IA comme celles de Cerebras, dont l'IPO en mai 2026 a été bien accueillie. En mai, Kog a publié une démo technique qui a atteint la une de Hacker News, prouvant qu'une vitesse de 3 000 tokens par seconde (TPS) par requête était atteignable — bien que sur un modèle léger open source de 2 milliards de paramètres, le Laneformer 2B. La startup promet à terme une accélération de 30x pour les grands modèles de langage (LLM). Cette démonstration a généré « 200 leads commerciaux concrets », selon Delalleau. Les premiers cas d'usage visés sont l'ingénierie logicielle assistée par IA — notamment pour les utilisateurs de Claude Code qui peuvent attendre des heures — ainsi que les plateformes de génération d'applications et de jeux par prompt. Kog concentre désormais ses efforts sur l'accélération des grands modèles, ses clients potentiels n'étant pas prêts à affiner des modèles plus petits. Son moteur KIE se distingue de ZML, autre startup française spécialisée dans l'inférence multi-puces, par un niveau d'optimisation encore plus bas au sein du GPU. Le tour de table seed de Kog a été co-dirigé par Varsity VC, fonds de l'ancien co-fondateur de Delalleau, Kamel Zeroual.

Source

techcrunch.com — Lire l'original →