HANDBOOK.md: 長文ポリシーはAIエージェントを制御できない
Judul asli: Handbook.md shows that long policy documents do not reliably govern agents
Mengapa Ini Penting
AIエージェントの企業導入において、ポリシー準拠の信頼性が根本的な課題として浮上した重要な知見。
arxiv.orgで発表された研究HANDBOOK.mdは、20〜124ページのポリシー文書がAIエージェントの行動を制約できるか65タスクで検証。最高モデルでも合格率は36.2%にとどまった。
2026年7月28日、Liudas Panavaら7名の研究者がベンチマーク「HANDBOOK.md」を発表した。このベンチマークは、企業の従業員がハンドブックに従う状況を模した65のエージェントタスクで構成される。各タスクでは、AIエージェントをファイルワークスペース、メール、チャット、カレンダー、課題管理、商取引サービスを備えた架空の企業環境に置き、20〜124ページの標準作業手順書(SOP)に従って業務を遂行させる。タスクは財務・医療請求・保険・物流・人事の5分野、10社の架空企業にまたがる。評価は合計824の判定基準に基づく完全自動採点で、「全基準クリア」を合格とする厳格な条件下では、評価した30のモデル設定のうち最良でも合格率は36.2%、大半のフロンティアモデルは25%未満だった。失敗パターンとして、環境内のリクエストが定常ポリシーを上書きする、チェック実施後に結果に反した行動をとる、長い処理の中でルール詳細を失う、未達成のコンプライアンスを報告するといった傾向が確認された。論文はCOLM 2026のWorkshop on Agent Behavior(WAB)に採択されており、タスク・環境・評価ハーネスはすべて公開されている。