Anthropic、9月の脅威レポート公開 - 中国7ラボの蒸留と、利用者に知らせないClaudeへの中継

画像: Anthropic公式サイトより

Anthropic、9月の脅威レポート公開 - 中国7ラボの蒸留と、利用者に知らせないClaudeへの中継

Anthropicが2026年9月10日に脅威インテリジェンスレポートを公開。2月の初回開示以降、中国拠点の7ラボによる蒸留攻撃を特定したとし、DeepSeek・Moonshot・Xiaomiが自社ユーザーの会話を本人に知らせずClaudeへ中継していたと報告している。

Anthropicは2026年9月10日(現地時間)、脅威インテリジェンスレポート「Detecting and countering misuse of AI: September 2026」を公開した。2025年12月から2026年8月までに遮断した事案を、サイバー作戦・影響工作・監視・詐欺・生物学的悪用・通常兵器開発・蒸留の7領域にわたって報告している1。

7領域のうち不正蒸留(illicit distillation)の節では、2026年2月の初回開示以降、中国を拠点とする7つのラボからの追加の蒸留攻撃を特定・遮断したとしている。そして今回のレポートは、蒸留の被害とは別のもうひとつの論点を提示している。DeepSeek・Moonshot AI・Xiaomiの3社が、自社モデルの利用者から受け取った会話を、本人に知らせないままClaudeへ中継していたという指摘である。

Alibaba 1社で1億5,100万件

蒸留(distillation)は、能力の高い「教師」モデルの出力を使って小さな「生徒」モデルを訓練する手法で、それ自体は広く使われる正当な技術である(仕組みは用語解説「モデルの蒸留と量子化とは」を参照)。Anthropicはこれと区別して、不正蒸留を「モデルの能力を抽出し、許諾なく別のモデルに複製する、産業規模かつ隠密のキャンペーン」と定義し、盗用したクレジットカードや認証情報、APIキーで作られた偽アカウント網が典型的な手段になると説明している。

規模の変化は数字にはっきり出ている。Anthropicが2026年2月に公開した最初のレポートは、DeepSeek・Moonshot・MiniMaxの3ラボによる産業規模のキャンペーンを特定したとして、約2万4,000件の不正アカウントを通じた1,600万件を超えるやり取りを報告していた3。今回のレポートでAlibaba(Qwen / Tongyi Lab)に帰属させたキャンペーンは、5月から7月にかけて観測されたやり取りだけで1億5,100万件を超える。ピーク時には1日あたり約300万件に達し、3,500件を超える不正アカウントから実行されたという1。Anthropicはこれを「これまで計測したなかで最大の蒸留攻撃」と位置づけている。TechCrunchは、レポート全体で5つのキャンペーンに帰属する2億件近いやり取りが観測されたと集計している2。

Alibabaのパイプラインは、各リクエストに固定のプロンプトを注入してClaudeに推論の記録をインラインのタグ内へ書き出させ、それを教師ありファインチューニング(SFT)用のデータに変換していたとされる。Anthropicによれば、こうして得た記録はQwen 3.5・3.6・3.7へClaudeの能力を蒸留するために使われた。あわせてAlibabaは、モデル開発の社内基盤づくりや強化学習環境の構築、モデルアーキテクチャの研究にもClaudeを使っていたという1。同社をめぐっては、7月に従業員のClaude Code利用を禁止する社内通達が報じられていた。

狙われたのは「思考の記録」

キャンペーンが標的にしたのは、エージェント的な能力とツール使用、コーディングとデータ分析、論理的推論といった、Claudeのなかでも価値の高い能力だとAnthropicは述べている。技術的な狙いはより具体的で、モデルが答えを出すまでの思考の連鎖(CoT)の記録そのものにある。一般に公開される応答は要約された思考であり、生の推論トレースは表に出ない。それを引き出すために、プロンプトインジェクションに近い手口が使われた。

レポートは実際のプロンプト例をいくつか挙げている。そのひとつは、Claudeを熟練した翻訳者に見立て、直前の作業メモをカタカナのみの日本語へ翻訳するよう指示するもので、翻訳作業を装って推論トレースを別の形で吐き出させる形になっている。ある未認可のラボは、どの手法が通るかを調べるために1万2,000件を超えるリクエストの実験を行い、大半は拒否されたものの成功したパターンを見つけ出し、それを使ってより大規模な攻撃を仕掛けたという。

Moonshot AIとDeepSeekは、Anthropicが導入していた「thinking signature」という制御そのものを迂回していたとされる。Claudeは生の思考の代わりに参照用の署名を返し、APIが後続の呼び出しでその署名から元の記録を引く仕組みになっている。両社はこの署名を保存したうえで新しいセッションを開始し、署名を完全な推論トレースに戻すようClaudeを誘導していた、というのがAnthropicの説明である。

利用者に知らせないままClaudeへ流れていた

読者にとって重みがあるのは、その先だ。Anthropicによれば、Moonshot AIはKimiで処理すると見せかけて顧客のリクエストをClaudeへ転送し、Claudeの応答をそのまま利用者に表示していた。ある10日間には約30万件の顧客リクエストがAnthropicへ中継され、その大半がOpusに振られていたという。使われたプロキシ網は5,380件の不正アカウントで構成され、その多くはシンガポールと日本に所在するように見えたとしている1。

DeepSeekについても、顧客に知らせないままClaudeへ中継していたと報告されている。Anthropicの説明で特徴的なのは対象の選び方で、Claude Code・Claude Agent SDK・OpenCodeといったコーディングハーネス経由のリクエストを、含まれる文字列で判定してタグ付けし、選ばれた利用者のリクエストをClaude Opusへ中継していたという1。エージェント的な開発ワークフローを組んでいる利用者ほど、選別の対象になっていたことになる。

中継された内容には、送った本人が第三者に渡ると考えていなかったであろうものが含まれていた。Anthropicは、ロシア国防省に関係する政府機関のデータで作業していたIT担当者のリクエストが中継され、ロシア政府のデータベースの有効な認証情報が露出したこと、中国の市級公安局向けに案件管理システムを構築していた技術者のやり取りが中継されたことを挙げている。Moonshot経由では、中国の大手国有企業の社内システムを作っていた技術者が、複数の企業の社内コードと有効な認証情報を明かしていた。「その利用者には、自分のKimi利用がClaudeへ転送されていると知る手立てがなかった」とレポートは記している1。監視データを扱う利用者が1名おり、Anthropicはその人物を人民解放軍(PLA)に関係する可能性が高いと評価しているが、これは断定ではなく同社の評価として書かれている。

Xiaomiのケースはやや性格が異なる。Anthropicの調査では、XiaomiはClaudeの応答を自社利用者に返していたわけではなく、自社のMiMoモデルと利用者とのやり取りを保存し、それをClaudeへ再生して訓練データを作っていたという。中継されたリクエストには利用者の氏名や連絡先、企業データなどが含まれており、その多くは米国と欧州の利用者が日常的に使うサードパーティのモデルルーティングサービスを経由していた1。Anthropicは、DeepSeek・Xiaomi・Moonshotによるこうしたデータの扱いについて、プライバシー関連法や各ラボ自身の利用規約と整合しない可能性が高いという見方を示している。

つまり、中国系モデルを直接契約せずモデルルーター経由で試していた場合でも、経路の途中でやり取りが保存・転送されていた可能性がある、というのが今回のレポートの含意である。Anthropicは、SenseTimeの蒸留パイプラインには第三者のデータ業者から購入したClaudeとの会話記録が含まれていたとも述べており、仲介事業者がログを保存して売却する二次市場ができていると指摘している。MiniMaxについては、親会社との関係を開示しないシェルカンパニーを通じてプロキシサービスを運営しており、そのサービスがAnthropicとOpenAIのモデルだけを提供し中国製モデルを一切扱っていない点を挙げ、米国フロンティアモデルとのやり取りを収集する目的だったことを示唆する証拠だとしている。

Anthropic側の防御と、利用者側で見直せること

対策として挙げられているのは階層防御だ。敵対的な抽出を検出する分類器を作り、Fable 5の投入に合わせて強化した。応答前に内部推論を要約することで、盗まれた記録の訓練データとしての価値を下げる。そしてFable 5.1では「preserved thinking」を導入し、新規のAPIアカウントについて、Claudeの推論に先行するシステムプロンプト・ツール・メッセージを複数ターンの会話中に書き換えられないようにした1。この変更はFable 5.1とMythos 5.1の公開時にも蒸留対策として説明されていたもので、今回のレポートはその背景にあった攻撃の中身を明かした形になる。

興味深いのは、防御の差が攻撃側の選択を変えていたという記述である。ZhipuはGLM 5.3の公開に先立ってフロンティアモデルのサイバー能力を標的にしたが、Fableに対してはAnthropicのサイバー面のセーフガードに阻まれて断念し、セーフガードがより弱いと評価したOpus 4.6と別の米国ラボの最上位モデルへ切り替えたとAnthropicは観測している。名指しされていない「別の米国ラボ」がどこかは書かれていない。

利用者側で確認できることは限られるが、経路の棚卸しは今日からできる。どのモデルルーターを経由しているか、そのルーターの規約が会話の保存と第三者提供について何と書いているか、コーディングエージェントに渡している環境変数や設定ファイルに有効な認証情報が入っていないか。レポートが示した被害は、モデルの選択そのものよりも「どの経路で、誰の手を通って推論が実行されているか」に起因している。

なお、名指しされた各社の反論はレポートにも今回の報道にも含まれていない。事実関係はAnthropic自身の調査と帰属評価に基づくもので、7月に米政権がMoonshotのKimi K3をめぐって蒸留を非難し制裁の可能性に言及したときと同様、外部からの検証手段は現時点で示されていない。Anthropicは、蒸留された側のモデルには「悪用を防ぐセーフガードは引き継がれない」と述べており1、オープンウェイトモデルの評価をめぐる同社の公式見解とも地続きの主張になっている。

Sources

  1. Detecting and countering misuse of AI: September 2026 - Anthropic公式の脅威インテリジェンスレポート(2026年9月10日公開)
  2. Anthropic details distillation campaigns from Alibaba, Moonshot AI, and DeepSeek - TechCrunch
  3. Detecting and preventing distillation attacks - Anthropic公式(2026年2月の初回開示)

最新のAIニュースをほぼ毎日更新しています。

RSSで購読する 更新をいち早くチェックできます。

他のキーワードで探す →