AIガードレールがサイバーセキュリティ研究を妨げる
Judul asli: How AI guardrails are impeding the work of offensive cybersecurity researchers
Mengapa Ini Penting
AI制限の設計が正規セキュリティ研究の有効性に直接影響し、業界全体のリスク管理に関わる問題として注目される。
OpenAIやAnthropicのAIモデルに設けられたセキュリティ制限が、正規の攻撃的サイバーセキュリティ研究者の業務を阻害しているとして批判を受けている。
OpenAIとAnthropicは悪意あるハッカーによるAIモデルの悪用を防ぐため、審査プログラムと厳格なガードレールを導入している。OpenAIは「Trusted Access for Cyber」、AnthropicはCyber Verification Programを提供し、審査を通過した研究者に限り制限を緩和したアクセスを付与する。
2026年6月、米国政府はAnthropicのモデル「Mythos」と「Fable」に輸出規制を課した。ガードレール回避が可能との報告が契機とされている。その後、Fable 5は7月1日に一般公開へ復帰し、Mythos 5は審査プロセスの一環として米国の審査済み組織のみに再提供されている。
セキュリティ研究者Mark Dowdは、「大企業がセキュリティにおいて何が安全かを恣意的に決定していることに違和感を覚える」と述べた。NCC GroupのChief ScientistであるChris Anleyは、AIモデルに脆弱性の悪用を試みさせることは、その脆弱性が修正に値するか確認する重要なステップだと説明。ガードレールが回答を拒否した場合、防御側の作業が損なわれると指摘している。