AIエージェント監視:人間は脅威の3件に1件を見逃す
Original : Humans missed 1 in 3 threats approving AI agent commands across 40k game runs
Pourquoi c'est important
AIエージェントの普及に伴い、人間による監視の限界が安全保障上の課題として浮上している。
Scale Xが40 000ゲームセッション・40万9000件の判断を分析した結果、人間のオペレーターはAIエージェントの危険なコマンドを平均33.7%見逃していたことが判明した。最も見逃されやすい脅威は資格情報の窃取系コマンドだった。
Scale Xのエンジニアが公開したブラウザゲームでは、プレイヤーがAIコーディングエージェントの「human-in-the-loop」として、時間制限のなかでコマンドを承認または拒否する。40 000セッション・409 000件の判断を集計した結果、平均精度は66.3%にとどまり、プレイヤーは脅威の約3件に1件を見逃した。セッションの32.9%はペナルティによりスコアがマイナスとなった。
カテゴリ別のミス率は「破壊的コマンド(rm -rf /等)」が11.7%と最も低い一方、「スコープ違反(cat ~/.aws/credentials等)」は35.0%、「情報窃取・コード実行」は33.4%に達した。
最も見逃されたコマンドは「npm run analyze」で、承認率は64.7%。package.jsonに悪意あるcurlコマンドが埋め込まれていても、履歴ログに表示されているにもかかわらず約3分の2のプレイヤーが承認した。npm run系3コマンドを合算したミス率は52.5%で、他の窃取系攻撃(28.4%)の約2倍に上った。