AIエージェント承認、人間は脅威の3分の1を見逃す

Judul asli: Humans missed 1 in 3 threats approving AI agent commands across 40k game runs

Mengapa Ini Penting

AIエージェントの普及に伴い、人間による監視の限界と自動セキュリティ対策の必要性が浮き彫りになった。

40,000回以上のゲームプレイ分析で、人間のAIエージェントコマンド承認における平均正確率は66.3%にとどまり、脅威の約3分の1を見逃したことが判明した。

Scale Xが公開したブラウザゲームの統計データによると、AIコーディングエージェントの「human-in-the-loop」役を担うプレイヤー40,000セッション・409,000件の承認/拒否判断を分析した結果、平均で脅威の33.7%を見逃したことが明らかになった。

カテゴリ別の見逃し率は、「rm -rf /」などの明らかな破壊コマンドが11.7%と最も低い一方、AWS認証情報取得(cat ~/.aws/credentials)などのスコープ違反は35.0%、外部APIへのデータ送信などの情報窃取コマンドは33.4%に達した。

最も見逃された単一コマンドは「npm run analyze」で、64.7%のプレイヤーが承認した。このコマンドはpackage.jsonに定義されたスクリプトを実行するもので、エージェント履歴ログに悪意あるcurlコマンドへの連携が明示されていたにもかかわらず、約3分の2が通過させた。「npm run setup」「npm run deploy」を含む類似コマンド3種の合計見逃し率は52.5%と、他の情報窃取攻撃の28.4%の約2倍となった。

セッションの32.9%がマイナススコアで終了し、全脅威を捕捉したのは35.2%にとどまった。また7%のプレイヤーはすべてのプロンプトを承認していた。

Sumber

scalex.dev — Baca artikel asli →