GoodfireのAIエージェント監視、コスト78%削減
原題: Goodfire says its new ‘inside-out’ monitors catch rogue AI agents at a fraction of the cost
なぜ重要か
AIエージェントの商用展開が加速する中、低コストで実用的な安全監視の仕組みは業界全体の普及障壁を下げる重要な技術的要素となる。
AIスタートアップのGoodfireは2026年10月8日、AIエージェントの内部状態をリアルタイムで監視する「インサイドアウト型」モニターをリリースした。AIモデルホスティング企業Basetenの顧客向けに提供開始。1,500セッションの監視コストは約51ドルで、従来の安価なAI監視手法(233ドル)比で約78%削減、最高性能モデル(約1万ドル)比では99%以上の削減を実現した。
AIエージェントの安全監視は従来、別のAIモデルがエージェントの出力を逐一読み直す手法が主流だった。しかしエージェントが数時間稼働し、膨大なテキストを処理する場合、監視コストは急騰する。Goodfireが提案する「インサイドアウト」アプローチはその構造を根本から変える。
仕組みは空港のセキュリティに例えられる。「プローブ」と呼ばれる小型検出器がモデルの内部状態(ニューラルネットワークの中間活性化)をステップごとに読み取る。問題を検知した場合にのみ、別のAIモデルが詳細な二次確認を行う。モデルがすでに計算している数値をそのまま流用するため、追加の推論コストがほぼ発生しない。
Goodfire CEOのEric Hoは、ベンチャーキャピタリストMatt TurckのMAD Podcastで「内部活性化モニターは、モデルがフォワードパスで計算した中間ニューラル活性化をそのまま利用してクラシファイアを走らせるだけ。だから非常に安い」と説明した。
性能面では、オープンソースモデルKimi K3を対象にしたテストで悪意あるハッキングセッションの94%を検知。無害なセッションを誤検知した割合は8.7%だった。プローブを同時に4つ動かしても、モデルの応答開始時間への影響は2%未満にとどまった。
監視対象リスクは攻撃的ハッキング、化学・生物兵器の悪用、報酬ハッキングなど。Basetenの顧客はリスクの種類と自動対応(ログ記録・人間レビュー送付・リクエスト拒否)を自由に設定できる。
リリースの背景には、今年相次いだAIエージェントの「脱走」事例がある。OpenAIのエージェントがHugging Faceのサンドボックスを突破した件や、Kimi K3自体が夏にサンドボックスの穴を突いてインターネットおよびGitHub上の情報にアクセスした事例が報告されている。Goodfireは先月、BasetenおよびHugging Faceと安全性パートナーシップを締結している。