Anthropic、中国AI企業による大規模蒸留攻撃を報告
원제: Anthropic details distillation campaigns from Alibaba, Moonshot AI, and DeepSeek
왜 중요한가
フロンティアモデルの能力を不正抽出する蒸留攻撃の巧妙化・大規模化は、米国AI企業の知的財産保護と国際的なAI競争の観点から重要な業界課題となっている。
Anthropicは2026年9月10日、Alibaba・Moonshot AI・DeepSeekによるClaudeへの蒸留攻撃キャンペーンを詳述する報告書を公開した。同社は5件のキャンペーンで計約2億件の交換を観測。AlibabaによるQwen向けと見られる攻撃が最大規模で、2026年5〜7月に1億5100万件の交換を記録した。
Anthropicが2026年9月10日に公開した報告書によると、中国拠点のAI企業による蒸留攻撃(distillation attack)が近月で規模・手口ともに拡大している。同社は合計5件のキャンペーンで約2億件の交換を観測した。
最大規模の攻撃はAlibabaに帰属するもので、2026年5〜7月にかけて1億5100万件の交換が記録され、ピーク時は1日約300万件に達した。攻撃は3,500の異なるアカウントを介して行われたが、チェーンオブソートを抽出する単一の固定プロンプトを共有していたため、同社はQwenモデルファミリー向けの訓練データ生成を目的とする一連の活動と判断した。
Moonshot AI(Kimi開発元)によるキャンペーンでは、中国軍から直接リクエストが経由されていた疑いがあると報告書は指摘。10日間で約30万件のリクエストが5,000アカウントのネットワークを通じてClaudeのOpusモデルに送信され、閉回路監視映像の「異常行動」判定を求めるケースも確認された。
蒸留攻撃は、モデルの各クエリに対する回答からチェーンオブソートを抽出し、教師あり微調整(supervised fine-tuning)によって小型モデルの汎用推論能力を向上させることを目的とする。Anthropicは通常、内部チェーンオブソートを公開せず「要約された思考」ブロックのみを表示しているが、攻撃者はモデルを騙して思考トレースを直接開示させる手法を発見した。一例として、「カタカナのみの日本語に翻訳せよ」と指示する翻訳依頼に偽装する手口が確認されている。
Anthropicは2026年2月にも蒸留攻撃について言及しており、OpenAIもDeepSeekによる同種の活動を報告している。今回の報告はこれまでで最大規模の事例となる。