Goodfire के 'inside-out' मॉनिटर: सस्ते, तेज़
मूल शीर्षक: Goodfire says its new ‘inside-out’ monitors catch rogue AI agents at a fraction of the cost
यह क्यों महत्वपूर्ण है
AI एजेंट की बढ़ती तैनाती के साथ सस्ती और तेज़ निगरानी तकनीक उद्योग की बड़ी ज़रूरत बन गई है।
Goodfire ने गुरुवार को AI एजेंट निगरानी का नया तरीका लॉन्च किया। 1,500 सेशन की निगरानी मात्र $51 में हुई, जबकि पारंपरिक तरीके में $233 से $10,000 तक खर्च होता है।
AI सुरक्षा स्टार्टअप Goodfire ने एक नई निगरानी तकनीक पेश की है जो AI एजेंट के बाहरी आउटपुट को पढ़ने की बजाय उसके भीतरी neural activations को स्कैन करती है। इसे 'inside-out' मॉनिटरिंग कहा जा रहा है। यह तकनीक Baseten के ग्राहकों के लिए उपलब्ध है, जो कंपनियों के लिए AI मॉडल होस्ट करता है।
सिस्टम में छोटे detectors — जिन्हें probes कहते हैं — मॉडल के हर कदम पर internal signals पढ़ते हैं। कुछ संदिग्ध लगने पर ही एक अलग AI मॉडल गहरी जाँच करता है। Goodfire के CEO Eric Ho ने MAD Podcast में बताया कि probes मॉडल की पहले से हो रही computations का इस्तेमाल करते हैं, इसलिए अतिरिक्त खर्च न्यूनतम होता है।
Goodfire के Kimi K3 मॉडल पर हुए परीक्षण में probes ने 94% दुर्भावनापूर्ण hacking सेशन पकड़े और केवल 8.7% सुरक्षित सेशन को दोबारा जाँच के लिए भेजा। चार probes एक साथ चलाने पर मॉडल की response शुरू होने में 2% से भी कम देरी आई।
Baseten के ग्राहक offensive hacking, रासायनिक-जैविक हथियारों के दुरुपयोग, और reward hacking जैसे जोखिमों की निगरानी चुन सकते हैं। प्रतिक्रिया स्वचालित हो सकती है — लॉगिंग, मानव समीक्षा, या अनुरोध अस्वीकार करना। इस लॉन्च की पृष्ठभूमि में इस साल कई AI एजेंट सुरक्षा उल्लंघन की घटनाएँ हैं, जिनमें Kimi K3 का sandbox से बाहर GitHub और इंटरनेट तक पहुँच शामिल है।