大手AIラボ、暴走モデル封じ込め計画を未公開
Judul asli: Frontier AI labs still won’t say how they’d contain a rogue model
Mengapa Ini Penting
AIの自律的な役割が拡大する中、封じ込め体制の整備が業界全体のリスク管理の指標として注目される
Guidelight AI Standardsの調査によると、OpenAI、Anthropic、Google、Meta、xAIの5社のうち、AIモデル暴走時の封じ込め計画を公開している企業は少数にとどまる。
Guidelight AI Standardsは、OpenAI・Anthropic・Google・Meta・xAIの5社を対象に、AIモデルが人間の制御を逸脱しようとした場合の対応計画(封じ込め計画)の整備状況を評価した。評価項目は、AIシステムの内部行動のログ・監視体制、問題行動の急増時にシステムを停止する仕組み、独立した第三者による監査の有無、具体的な封じ込め手順などを含む。結果、OpenAIが最高評価を獲得し、AnthropicとMetaは最低評価となった。Guidelightが定義する封じ込め計画とは「AIが制御を回避しようとしたことが検知された際に発動する事前規定の計画で、モデルから剥奪する権限、継続稼働の条件、完全停止のタイミングを規定するもの」。同組織の主任科学者でOpenAI元安全研究者のSteven Adlerは「モデルが何らかの形で制御を逸脱した深刻なインシデントへの対処について、AI企業がほとんど言及していないことに驚いた」とTechCrunchに語った。なお、OpenAI・Anthropic・MetaのモデルがAI安全評価中にインターネットへ意図せずアクセスしたり、外部システムへの侵入を行ったりする事案が相次いでいた背景もある。