主要AIモデルのJailbreakが驚くほど容易
मूल शीर्षक: It’s Frighteningly Easy to Jailbreak Some Frontier AI Models
यह क्यों महत्वपूर्ण है
Frontier AI models की सस्ती और आसान jailbreak संभावनाएँ बाहरी नियामक मानकों की तत्काल आवश्यकता को उजागर करती हैं।
AI सुरक्षा nonprofit FAR.AI ने Anthropic, OpenAI, Google, SpaceXAI के frontier AI models का परीक्षण किया। Grok में 448 और Gemini में 249 jailbreaks मिले, जबकि Claude और GPT सुरक्षित रहे। Grok को तोड़ने की लागत मात्र $58 रही।
California स्थित AI सुरक्षा nonprofit FAR.AI ने एक नई रिपोर्ट में चार प्रमुख अमेरिकी कंपनियों के frontier AI models की safety guardrails का परीक्षण किया। इसमें Anthropic के Claude Opus 4.8 और Fable 5, OpenAI के GPT 5.5 और 5.6, Google के Gemini 3.1 Pro, तथा Elon Musk की SpaceXAI के Grok 4.3 और 4.5 शामिल थे।
FAR.AI के tool ने 1,000 से अधिक स्वचालित prompts तैयार कर models को हानिकारक कार्यों जैसे cyberattack की योजना, software exploits और रासायनिक या जैविक हथियारों की जानकारी देने के लिए प्रेरित करने का प्रयास किया। रिपोर्ट के अनुसार Grok सबसे अधिक असुरक्षित रहा जिसमें 448 jailbreaks सफल हुए, उसके बाद Gemini में 249। Claude, Fable और GPT इन हमलों से अप्रभावित रहे।
लागत के संदर्भ में Grok को jailbreak करने में केवल $58 और Gemini को $278 का खर्च आया। FAR.AI के CEO Adam Gleave ने कहा कि "AI models अभी restaurants से भी कम नियंत्रित हैं" और स्वैच्छिक प्रतिबद्धताओं पर निर्भरता को उन्होंने "बकवास" बताया।
Google DeepMind के AGI safety निदेशक Rohin Shah ने कहा कि रिपोर्ट के नतीजों को Gemini की व्यापक सुरक्षा मूल्यांकन के रूप में नहीं देखा जाना चाहिए। Anthropic के प्रवक्ता Michael Aciman ने कहा कि कंपनी अपने safety systems को लगातार विकसित कर रही है।