llama.cpp: स्थानीय AI रनर अब आधिकारिक वेबसाइट के साथ

मूल शीर्षक: llama.cpp

यह क्यों महत्वपूर्ण है

llama.cpp की आधिकारिक वेबसाइट स्थानीय AI इंफरेंस को मुख्यधारा में लाने की दिशा में एक महत्वपूर्ण कदम है, जो प्राइवेसी-केंद्रित AI उपयोग को बढ़ावा देता है।

ओपन-सोर्स लोकल AI इंजन llama.cpp का आधिकारिक होम llama.app लॉन्च हुआ। यह टूल बिना API key, बिना telemetry के उपयोगकर्ता के कंप्यूटर पर ही AI मॉडल चलाने देता है। GitHub पर 123,500 से अधिक Stars के साथ यह प्रोजेक्ट अत्यंत लोकप्रिय है।

llama.cpp एक ओपन-सोर्स AI इंफरेंस इंजन है जो उपयोगकर्ता के स्थानीय डिवाइस पर ही बड़े भाषा मॉडल (LLM) चला सकता है। इसका आधिकारिक होम पेज llama.app अब लॉन्च हो गया है, जहाँ से एक कमांड `curl -LsSf https://llama.app/install.sh | sh` के ज़रिए इंस्टॉलेशन संभव है। Brew और Winget जैसे पैकेज मैनेजर भी समर्थित हैं।

इस टूल की प्रमुख विशेषता यह है कि सभी डेटा और अनुरोध डिवाइस से बाहर नहीं जाते — कोई API key नहीं, कोई telemetry नहीं, कोई क्लाउड निर्भरता नहीं। `llama serve` कमांड से मॉडल सर्व किया जा सकता है और HuggingFace के pi-llama plugin के साथ लोकल कोडिंग agent भी चलाया जा सकता है।

हार्डवेयर समर्थन की दृष्टि से llama.cpp अत्यंत व्यापक है: Apple Silicon (M Pro, M Max, M Ultra), NVIDIA (RTX 3090, 4090, 5090, A100, H100), AMD (MI300, Radeon RX), Intel Arc, NVIDIA Jetson और DGX Spark सभी समर्थित हैं — एक ही binary से।

समर्थित मॉडलों में Alibaba का Qwen 3.6 (multimodal reasoning, Dense और MoE variants), Google का Gemma 3 और Gemma 4 (128K context, 140+ भाषाएँ, Gemini 3 तकनीक आधारित), तथा OpenAI का GPT-OSS (GPT-2 के बाद पहला open-weight मॉडल, function calling और tool use सहित) शामिल हैं।

स्रोत

llama.app — मूल लेख पढ़ें →