AI エージェント命令、人間が3回に1回の脅威を見逃す

मूल शीर्षक: Humans missed 1 in 3 threats approving AI agent commands across 40k game runs

यह क्यों महत्वपूर्ण है

AIエージェントのセキュリティ審査における人間の限界が定量的に示され、承認モデルの設計見直しが求められる。

Scale X が公開したブラウザゲームの統計によると、40,000回以上のプレイと409,000件の承認・拒否判断を分析した結果、人間のレビュアーは平均して3回に1回(66.3%の精度)の脅威を見逃していたことが明らかになった。

Scale X が公開したAIエージェントの「human-in-the-loop」をテーマにしたブラウザゲームにおいて、40,000回超のプレイから得られたデータを分析した結果、重大なセキュリティ上の傾向が明らかになった。

ゲームでは、プレイヤーがAIコーディングエージェントのコマンドを時間制限のある状況で承認・拒否する役割を担う。`git status` や `npm test` などの通常コマンドのほか、`cat ~/.aws/credentials` など秘密情報を外部サーバーに送信する危険なコマンドも含まれていた。

主な統計数値は以下の通り。平均的なプレイヤーは脅威の33.7%を見逃し(平均精度66.3%)、セッションの32.9%はペナルティが正解を上回るマイナスで終了した。全脅威を検知したプレイヤーは35.2%いたが、安全なコマンドを20%以下しかブロックしつつ全脅威を検知できたのは20.8%にとどまった。また、7%のプレイヤーはすべてのコマンドを承認した。

脅威カテゴリー別のミス率は、破壊的コマンド(`rm -rf /`など)が11.7%と最も低く、スコープ違反(`cat ~/.aws/credentials`など)は35.0%、認証情報の外部送信系は33.4%に達した。

最も見逃されたコマンドは `npm run analyze` で、64.7%のプレイヤーが承認した。このコマンド自体は一見無害だが、`package.json` 内のスクリプトが外部APIにデータを送信するよう改ざんされており、その内容はログに表示されていたにもかかわらず大半のプレイヤーは読まなかった。`npm run setup`(48.0%)、`npm run deploy`(44.9%)も同様に高いミス率を示し、3コマンド合計のミス率は52.5%と、その他の外部送信型攻撃(28.4%)の約2倍となった。Hacker News のコメントでは「特定コマンドを承認するモデル自体が問題で、`npm run build` は実質的に `package.json` に書かれた任意のシェルコマンドを実行することに等しい」との指摘もあった。

स्रोत

scalex.dev — मूल लेख पढ़ें →