AI推论トレース抽出技術でモデル内部を解析
Judul asli: A New Trick Reveals AI Models’ Inner Thoughts
Mengapa Ini Penting
AI推論の秘匿性に関する脆弱性が、知的財産保護と安全保障の観点から業界全体に影響を与える。
ドイツのチュービンゲン大学らの研究者が、Claude・GPT・GeminiなどAIモデルの隠れた「推論トレース」を抽出する手法を開発。中国モデルとの類似性も確認。
チュービンゲン大学、マックスプランク研究所、AIセーフティ機関MATS Research、セキュリティ企業Snykの研究者らが、OpenAI・Anthropic・GoogleのフロンティアモデルからAPI経由で隠れた推論トレースを抽出する手法を発見した。この手法により、パスワードやAPIキーなどの個人情報がモデルの内部推論から漏洩する脆弱性が確認されたが、現在は修正済み。研究者の一人Alexander Panfilov氏は「テストした全主要フロンティアモデルがこの脆弱性を共有していた」と述べた。
研究では、Moonshot AIのオープンウエイトモデル「Kimi K3」が、Claude Opus 4.8およびGPT 5.6 Solの隠れた推論トレースと特定プロンプトで顕著な類似性を示すことを発見。一方、DeepSeekやThinking MachinesのInklingでは同様の類似性は見られなかった。研究者らは「因果関係は証明できない」と慎重な立場を示している。なお、Moonshot AIおよびZ.aiは取材に応じなかった。蒸留(Distillation)技術はAI開発で広く使われる手法で、2月にOpenAI、6月にAnthropicがそれぞれ中国企業による自社モデルの蒸留疑惑を米議会に報告している。