AI की छिपी सोच उजागर करने की नई तकनीक

मूल शीर्षक: A New Trick Reveals AI Models’ Inner Thoughts

यह क्यों महत्वपूर्ण है

यह तकनीक AI models की सुरक्षा और बौद्धिक संपदा संरक्षण पर गंभीर सवाल उठाती है।

जर्मनी की University of Tübingen के शोधकर्ता Alexander Panfilov और टीम ने Claude, GPT, Gemini जैसे frontier AI models की छिपी 'reasoning traces' निकालने का तरीका खोजा। इससे passwords और API keys का खुलासा भी हो सकता है, जो बाद में ठीक किया गया।

University of Tübingen, Max Planck Institute, MATS Research और Snyk के शोधकर्ताओं ने एक ऐसी तकनीक विकसित की है जो OpenAI, Anthropic और Google के frontier AI models की छिपी 'reasoning traces' को API के ज़रिए निकाल सकती है। ये reasoning traces वो लिखित सोच-विचार के चरण होते हैं जो model किसी जटिल समस्या को हल करते समय अंदर ही अंदर करता है, और कंपनियाँ इन्हें प्रतिस्पर्धियों से छिपाती हैं।

शोधकर्ताओं ने पाया कि Moonshot AI का open-weight चीनी model Kimi K3, Claude Opus 4.8 और GPT 5.6 Sol की hidden reasoning traces से कुछ prompts के लिए उल्लेखनीय समानता दर्शाता है। हालांकि शोधकर्ताओं ने स्पष्ट किया कि यह 'causally distillation' साबित नहीं करता। वहीं DeepSeek और US कंपनी Thinking Machines के Inkling model में ऐसी समानता नहीं मिली।

Distillation एक प्रचलित तकनीक है जिसमें बड़े models की क्षमताएँ छोटे models में कॉपी की जाती हैं। हाल ही में यह विवाद का विषय बन गई है — फरवरी में OpenAI ने अमेरिकी सांसदों को बताया कि DeepSeek ने उनके model को कॉपी किया, और जून में Anthropic ने कहा कि Alibaba ने उनके models को systematically distill करके Qwen बनाया। Moonshot AI और Z.ai ने टिप्पणी के अनुरोध का जवाब नहीं दिया।

Panfilov के अनुसार, यह vulnerability सभी प्रमुख frontier model providers में पाई गई और इससे व्यक्तिगत जानकारी जैसे passwords और API keys का भी खुलासा हो सकता था, जिसे अब ठीक कर दिया गया है।

स्रोत

wired.com — मूल लेख पढ़ें →