独自LLM APIから推論トレースを盗む研究が発表

मूल शीर्षक: Stealing Reasoning Traces from Proprietary LLM APIs

यह क्यों महत्वपूर्ण है

LLM APIの暗号化推論ブロックがセッション間で再利用可能である点は、プロプライエタリモデルの知的財産保護とユーザーデータのプライバシー双方に対する重大なリスクを示している。

MATS Research、ELLIS Institute Tübingen等の研究者チームが、Anthropic、OpenAI、Googleの独自LLMが返す暗号化された推論ブロック(chain-of-thought)を、弱いモデルを経由して復元できることを実証した。2回のAPIコールで強力なモデルの隠れた推論を平文で取得可能とされる。

Alexander Panfilov氏、David Schmotz氏、Ilia Shumailov氏らの研究チームが「Stolen Thoughts」と題した論文を発表し、主要なLLMプロバイダーのAPIから暗号化推論トレースを復元する手法を明らかにした。

**手法の概要**

AnthropicやOpenAI、Googleは、モデルの推論過程(chain-of-thought)を暗号化されたブロックとしてクライアントに返し、会話継続時にサーバーへ送り返す仕組みを採用している。研究チームはこれらのブロックが「ポータブル」であること、すなわちセッションやユーザー、モデルをまたいで再利用できることを発見した。

この脆弱性を利用し、強力なモデル(例:Claude Opus 4)が生成した暗号化推論ブロックを、同プロバイダーの弱いモデル(例:Claude Haiku 4.5)に注入してjailbreakすることで、強力なモデルの隠れた推論を平文で取得できることを実証した。強力なモデルを直接攻撃せず、反蒸留(anti-distillation)のセーフガードも回避できるとしている。

**実被害の規模**

GitHubおよびHugging Faceから収集した6,708件の公開エージェントトラジェクトリに対し、同パイプラインを適用した結果、315,320件の推論ブロックを復元した。その中には351件の機密情報が含まれており、内訳は技術的識別子204件、個人情報(PII)126件、認証情報(Credentials)23件などとなっている。

**実験の詳細**

120件のCodeforcesプログラミング問題を使用した評価では、APIが報告する隠れた思考トークン数と、復元された推論のトークン数が高い相関を示した。また、Kimi-K3モデルへの適用や、jailbreakによる悪用リスクの検討、要約の不忠実さなどについても追加検証が行われた。

स्रोत

stolen-thoughts.com — मूल लेख पढ़ें →