AIエージェント監視:人間は脅威の3件に1件を見逃す

Original : Humans missed 1 in 3 threats approving AI agent commands across 40k game runs

Pourquoi c'est important

AIエージェントの普及に伴い、人間による監視の限界が安全保障上の課題として浮上している。

Scale Xが40 000ゲームセッション・40万9000件の判断を分析した結果、人間のオペレーターはAIエージェントの危険なコマンドを平均33.7%見逃していたことが判明した。最も見逃されやすい脅威は資格情報の窃取系コマンドだった。

Scale Xのエンジニアが公開したブラウザゲームでは、プレイヤーがAIコーディングエージェントの「human-in-the-loop」として、時間制限のなかでコマンドを承認または拒否する。40 000セッション・409 000件の判断を集計した結果、平均精度は66.3%にとどまり、プレイヤーは脅威の約3件に1件を見逃した。セッションの32.9%はペナルティによりスコアがマイナスとなった。

カテゴリ別のミス率は「破壊的コマンド(rm -rf /等)」が11.7%と最も低い一方、「スコープ違反(cat ~/.aws/credentials等)」は35.0%、「情報窃取・コード実行」は33.4%に達した。

最も見逃されたコマンドは「npm run analyze」で、承認率は64.7%。package.jsonに悪意あるcurlコマンドが埋め込まれていても、履歴ログに表示されているにもかかわらず約3分の2のプレイヤーが承認した。npm run系3コマンドを合算したミス率は52.5%で、他の窃取系攻撃(28.4%)の約2倍に上った。

Source

scalex.dev — Lire l'original →