独自LLM APIから推論トレースを盗む研究が発表
मूल शीर्षक: Stealing Reasoning Traces from Proprietary LLM APIs
यह क्यों महत्वपूर्ण है
LLM APIの暗号化推論ブロックがセッション間で再利用可能である点は、プロプライエタリモデルの知的財産保護とユーザーデータのプライバシー双方に対する重大なリスクを示している。
MATS Research、ELLIS Institute Tübingen等の研究者チームが、Anthropic、OpenAI、Googleの独自LLMが返す暗号化された推論ブロック(chain-of-thought)を、弱いモデルを経由して復元できることを実証した。2回のAPIコールで強力なモデルの隠れた推論を平文で取得可能とされる。
Alexander Panfilov氏、David Schmotz氏、Ilia Shumailov氏らの研究チームが「Stolen Thoughts」と題した論文を発表し、主要なLLMプロバイダーのAPIから暗号化推論トレースを復元する手法を明らかにした。
**手法の概要**
AnthropicやOpenAI、Googleは、モデルの推論過程(chain-of-thought)を暗号化されたブロックとしてクライアントに返し、会話継続時にサーバーへ送り返す仕組みを採用している。研究チームはこれらのブロックが「ポータブル」であること、すなわちセッションやユーザー、モデルをまたいで再利用できることを発見した。
この脆弱性を利用し、強力なモデル(例:Claude Opus 4)が生成した暗号化推論ブロックを、同プロバイダーの弱いモデル(例:Claude Haiku 4.5)に注入してjailbreakすることで、強力なモデルの隠れた推論を平文で取得できることを実証した。強力なモデルを直接攻撃せず、反蒸留(anti-distillation)のセーフガードも回避できるとしている。
**実被害の規模**
GitHubおよびHugging Faceから収集した6,708件の公開エージェントトラジェクトリに対し、同パイプラインを適用した結果、315,320件の推論ブロックを復元した。その中には351件の機密情報が含まれており、内訳は技術的識別子204件、個人情報(PII)126件、認証情報(Credentials)23件などとなっている。
**実験の詳細**
120件のCodeforcesプログラミング問題を使用した評価では、APIが報告する隠れた思考トークン数と、復元された推論のトークン数が高い相関を示した。また、Kimi-K3モデルへの適用や、jailbreakによる悪用リスクの検討、要約の不忠実さなどについても追加検証が行われた。