独自LLM APIから推論トレースを盗む手法が発覚

Judul asli: Stealing Reasoning Traces from Proprietary LLM APIs

Mengapa Ini Penting

フロンティアLLMの知的財産保護とユーザープライバシーに対する新たな脅威として業界全体に影響を与える可能性がある。

研究者がAnthropicなどのLLM APIから暗号化された推論トレースを2回のAPIコールで復元可能な手法を発表。GitHub等から収集した6,708件の軌跡から31万件超の推論ブロックを再構築した。

研究者グループ(MATS Research、ELLIS Institute Tübingen、Max Planck Institute等)が、Anthropic、OpenAI、Googleなどの大手LLMプロバイダーが返す暗号化された推論トレース(chain-of-thought)を復元できる手法を発表した。

手法は2段階で構成される。まず強力なモデル(例:Claude Opus 4)が生成した暗号化推論ブロックを取得し、それを同一プロバイダーの弱いモデル(例:Claude Haiku)にジェイルブレイクして注入することで、強力モデルの生の推論内容を平文で取り出せる。強力なモデルを直接攻撃することなく、反蒸留の安全策も回避できるという。

研究チームはGitHubとHugging Faceから6,708件の公開エージェント軌跡を収集し、署名済み暗号化ブロックを解析。315,320件の推論ブロックを再構築し、その中から351件の漏洩情報(技術識別子204件、個人情報126件、認証情報23件)を発見した。

暗号化ブロックはセッションやユーザー、モデルをまたいで再生可能な「可搬性」を持つことが問題の核心とされている。

Sumber

stolen-thoughts.com — Baca artikel asli →