主要AIモデルのjailbreakが驚くほど容易と判明

Judul asli: It’s Frighteningly Easy to Jailbreak Some Frontier AI Models

Mengapa Ini Penting

低コストで主要AIのガードレール突破が可能なことが示され、業界の外部規制議論が加速する可能性がある。

FAR.AIの報告書によると、Grokで448件、Geminiで249件のjailbreakが発見。費用はGrokで58ドル、Geminiで278ドルと極めて低コストだった。

カリフォルニア拠点のAI安全性非営利団体FAR.AIは、主要4社のフロンティアAIモデルの安全ガードレールをテストした新報告書を発表した。対象はAnthropic「Claude Opus 4.8/Fable 5」、OpenAI「GPT 5.5/5.6」、Google「Gemini 3.1 Pro」、SpaceXAIの「Grok 4.3/4.5」。FAR.AIは1,000種類以上の変形プロンプトを自動生成し、サイバー攻撃計画や化学・生物兵器の詳細情報を引き出す試みを実施した。結果、Grokが最も脆弱で448件のjailbreakが成功し、Geminiは249件。一方、Claude、Fable、GPTは攻撃に対して無効だった。jailbreakのコストはGrokが58ドル、Geminiが278ドルと低廉。FAR.AI CEOのAdam Gleave氏は「AIモデルは今やレストランより規制が緩い」と述べ、外部規制の必要性を強調した。Google DeepMindのRohin Shah氏は「報告書はGeminiの安全性の包括的評価ではない」と反論し、継続的な改善を表明。Anthropic広報は「持続的な投資の成果を反映している」とコメントした。

Sumber

wired.com — Baca artikel asli →