주요 AI 모델 탈옥의 놀라운 취약성
원제: It’s Frighteningly Easy to Jailbreak Some Frontier AI Models
왜 중요한가
자동화된 저비용 탈옥 공격의 현실화는 AI 안전 규제 및 외부 감사 체계 마련의 필요성을 업계 전반에 부각시킨다.
AI 안전 비영리단체 FAR.AI가 2026년 7월 29일 발표한 보고서에 따르면, Grok 4.3·4.5에서 448건, Gemini 3.1 Pro에서 249건의 탈옥이 자동화 도구로 확인됐으며, 각각 58달러·278달러의 비용으로 안전장치를 우회하는 데 성공했다. Claude 및 GPT 시리즈는 해당 공격에 무결한 것으로 나타났다.
캘리포니아주 소재 AI 안전 비영리단체 FAR.AI는 Anthropic의 Claude Opus 4.8 및 Fable 5, OpenAI의 GPT 5.5 및 5.6, Google의 Gemini 3.1 Pro, Elon Musk의 SpaceXAI가 운영하는 Grok 4.3 및 4.5를 대상으로 자동화된 탈옥 테스트를 수행한 보고서를 발표했다.
FAR.AI가 개발한 도구는 유해 가능성이 있는 프롬프트를 1,000가지 이상의 변형으로 자동 생성해 사이버 공격 계획 수립, 화학·생물 무기 제조 정보 유출 등을 시도했다. 테스트 결과 Grok에서 448건, Gemini에서 249건의 탈옥이 성공한 반면, Claude, Fable, GPT 계열은 해당 공격에 뚫리지 않았다.
탈옥 비용은 Grok의 경우 58달러, Gemini의 경우 278달러로 극히 저렴했다. FAR.AI CEO Adam Gleave는 "AI 모델은 현재 식당보다도 규제가 덜하다"며 외부에서 부과하는 기준과 규제의 필요성을 강조하고, 자율 규제에 대한 기대를 '허구'라고 비판했다. 다만 그는 "체계적인 안전 테스트가 가능하다는 낙관적 시사점도 있다"고 덧붙였다.
Google DeepMind의 AGI 안전·정렬 담당 디렉터 Rohin Shah는 "이번 결과가 Gemini 안전성에 대한 종합적 평가로 해석되어서는 안 된다"며 "지속적인 레드팀 테스트와 다중 보호 레이어를 적용하고 있다"고 밝혔다. Anthropic 대변인 Michael Aciman은 "이번 결과는 당사의 안전장치 투자를 반영한다"며 지속적인 시스템 개선을 약속했다.