Kog、GPUから推論性能を最大限引き出す技術に注力

मूल शीर्षक: Kog is going deeper to squeeze more inference out of GPUs

यह क्यों महत्वपूर्ण है

GPU ऑप्टिमाइज़ेशन से मौजूदा हार्डवेयर पर AI inference लागत और विलंबता को कम करने की संभावना उद्योग के लिए अत्यंत महत्वपूर्ण है।

फ्रांसीसी स्टार्टअप Kog ने GPU सॉफ्टवेयर ऑप्टिमाइज़ेशन के ज़रिए LLM inference को 30 गुना तेज़ करने का लक्ष्य रखा है। CEO Gaël Delalleau के अनुसार, AMD MI300X और Nvidia H200 GPU पर 3,000 TPS का डेमो दिखाया जा चुका है और 200 से अधिक व्यावसायिक लीड प्राप्त हुए हैं।

फ्रांस की AI स्टार्टअप Kog ने मई 2026 में Hacker News पर एक tech preview जारी किया, जिसमें यह साबित किया गया कि मानक datacenter GPU — जैसे AMD MI300X और Nvidia H200 — पर अत्यंत तेज़ single-request decoding संभव है। Kog का दावा है कि उसका Kog Inference Engine (KIE) मौजूदा GPU हार्डवेयर पर सॉफ्टवेयर ऑप्टिमाइज़ेशन के माध्यम से LLM inference को 30 गुना तेज़ कर सकता है।

डेमो में 2 बिलियन पैरामीटर वाले ओपन-सोर्स मॉडल Laneformer 2B के साथ 3,000 प्रति-अनुरोध tokens per second (TPS) हासिल किए गए। CEO Gaël Delalleau के अनुसार, tech preview के बाद 200 से अधिक ठोस व्यावसायिक leads मिले हैं।

Kog के प्राथमिक लक्षित ग्राहक सॉफ्टवेयर इंजीनियरिंग क्षेत्र में हैं — जैसे Claude Code के ऐसे उपयोगकर्ता जिन्हें घंटों प्रतीक्षा करनी पड़ती है। इसके अलावा, ऐसे design partners भी हैं जो AI प्रॉम्प्ट से games और apps तैयार करते हैं और जिनके लिए तेज़ inference का मतलब अधिक राजस्व है।

Kog ने पाया कि संभावित ग्राहक अभी small models को fine-tune करने के लिए तैयार नहीं हैं, इसलिए कंपनी का फोकस अब larger models को accelerate करने पर है। Delalleau का मानना है कि नए GPU में बढ़ती memory bandwidth को सॉफ्टवेयर की मदद से unlock किया जा सकता है।

Kog की seed round में Varsity VC ने सह-नेतृत्व किया, जिसके संस्थापक Kamel Zeroual, Delalleau के पूर्व co-founder हैं। France की ही एक अन्य कंपनी ZML भी hardware-agnostic inference software पर काम कर रही है, लेकिन Kog का दृष्टिकोण Stanford की Hazy Research लैब जैसा गहरे GPU acceleration स्तर पर केंद्रित है।

स्रोत

techcrunch.com — मूल लेख पढ़ें →