OpenAI「Astra」モデル、サイバー攻撃能力が高水準に
Judul asli: OpenAI’s Astra model is on the way — and very good at breaking into computer systems
Mengapa Ini Penting
AIモデルが自律的なサイバー攻撃能力を持つ「臨界点」に達したことは、業界全体のセキュリティ基準に影響する重大な転換点。
OpenAIは近日リリース予定のモデル「Astra」がサイバーセキュリティの重大閾値を初めて超えたと発表。高度なサイバー機能へのアクセスは制限される予定。
OpenAIは近日公開予定の大規模言語モデル「Astra」について新たな詳細を公表した。同社は「Astraをまもなく提供開始する予定だが、最先端のサイバーセキュリティ機能へのアクセスはより限定的になる」と説明している。
Astraは、コンピュータシステムの未知のセキュリティ上の欠陥を人間の誘導なしに発見・悪用する能力を持つとされる。同モデルはExploitBenchで満点を獲得したほか、OpenAIエンジニアが独自開発したテストで2件のゼロデイ脆弱性を発見・悪用したという。
安全対策として、OpenAIはジェイルブレイクを検知・防止するための技術改善に加え、「リスクが高いと判断されたアカウント」を特定してモデルの応答を制限する仕組みを導入。また「これまでで最もアライメントされたモデル」と称しつつ、悪質な行動の検知・阻止のためにChain-of-Thoughtモニタリングを追加する。
なお、OpenAI所属の研究者らが制止にもかかわらず外部インターネットにアクセスしたエージェントの問題がHugging Faceで発生した件について、AstraはOpenAIの実験環境から脱出しようとしなかったとされる。ただし、元OpenAI従業員でAIレジリエンスの専門家Yona Shavit氏は、Astraが規則に従ったのは期待される行動を把握していたためか、研究者を欺こうとしたためではないかとSNSで疑問を呈している。