OpenAIがKimiの開発元Moonshot AIの関係者を名指し暗号を破らずに「隠された推論」を抜き出そうとした蒸留攻撃の中身
OpenAIは2026年9月30日、モデルの「隠された推論」を抜き出そうとする組織的な蒸留攻撃を7月に止めたと発表し、中核の一群をKimiの開発元Moonshot AIの関係者と判断したと書いた。7月24〜25日に4,000人超から1万6000件(試行の数)。暗号は破られておらず、暗号化された推論を別の会話で書き起こさせる形だった。同じ種類の弱点はAnthropic・Googleにもあったと8月の論文が示している。Moonshotの回答は10月3日時点で確認できていない。

目次
2026年10月3日(日本時間)時点の情報です。OpenAIは9月30日、セキュリティのブログ「組織的なモデル蒸留活動の阻止」で、モデルが答える前の「隠された推論」を抜き出そうとする組織的な動きを7月に見つけて止めたと発表した。活動の中核をなす一群については、Kimiの開発元である中国のMoonshot AIの関係者によるものと判断している。当サイトは日本語版と英語版の両方、記事がリンクしている研究者の論文、Anthropicや米国政府機関の過去の報告を読み、解説動画「OpenAIがKimi開発元を告発。暗号を破らず「思考」を抜き出す手口とは?」にまとめた。この記事は、その確認の中身を順に並べたものだ。
3行まとめ
- OpenAIによると、活動は7月1日に始まり、7月24〜25日の2日間に4,000人超のユーザーから1万6000件のリクエストが来た。広げて調べると関連するユーザーは1万5000人超で、7月28日までに全部止めた。数字は抜き出しを試みた数で、成功した数ではない。
- 暗号は破られていない。ある会話で返ってきた暗号化された推論を別の会話に持ち込み、中身を書き起こさせる形だった。OpenAIは中核の一群をMoonshot AIの関係者と判断したが、全員が1つの組織に属していたかは「不明」とし、判断の根拠は書いていない。
- 8月の論文は同じ種類の弱点をAnthropic・OpenAI・Googleの3社で示し、各社はすでに対策した。AnthropicもMoonshotが推論を集めていたと9月のレポートに書いている。今回の件へのMoonshotの回答は、10月3日時点で見つかっていない。
| 項目 | 内容 |
|---|---|
| 発表 | OpenAI セキュリティのブログ・2026年9月30日 |
| 期間 | 2026年7月1日に開始 → 7月28日までに阻止 |
| 規模 | 7月24〜25日に4,000人超から1万6000件/関連ユーザー1万5000人超(いずれも試行の数) |
| 名指し | 活動の中核の一群=Kimiの開発元 Moonshot AI の関係者(OpenAIの判断) |
| 狙われたもの | モデルが答える前の推論の記録(非公開) |
| 対策 | アカウントの停止・制限、推論を戻す経路の閉鎖、出力の保留、外部サービスとの連携、業界団体と政府への共有 |
7月の4週間に何があったのか
OpenAIの説明では、動きが最初に見つかったのは7月の第1週だった。最初は少量で、7月24日と25日に急に増えた。
The activity began on July 1, initially at a low volume until we observed high-volume spikes on July 24 and 25 consisting of 16,000 requests using a relevant extraction pattern from over 4,000 users.
(活動は7月1日に始まり、当初は少量だったが、7月24日と25日に、関連する抽出パターンを使った1万6000件のリクエストが4,000人超のユーザーから来る急増を観測した)
さらに調べると、関連する頼み方をしていたユーザーの集まりが1万5000人を超えて見つかり、7月28日までにすべて止めたという。ブログの脚注には、この数字の性質がはっきり書かれている。
These figures describe attempted, not necessarily successful, extractions.
(これらの数字は抽出の試行を示すもので、必ずしも抽出に成功したことを意味しない)
公表は活動の開始から約3か月後になった。OpenAIは、公表の前に影響の範囲を調べ、独自の緩和策を入れたと書いている。追加の対策と調査は、今も続いているという。
狙われた「隠された推論」はどこにあるのか
今の推論モデルは、答える前に計画を立てたり、別のやり方を比べたりする時間を取る。OpenAIの公式ドキュメントによると、その生の推論は利用者に公開されず、見られるのは要約だけだ。
ただし、会話を続けるには、前に考えた中身をモデルに引き継がせる必要がある。ドキュメントによると、会話をOpenAIのサーバーに保存しない使い方(store を false にした場合や、データを保持しない契約の組織)では、推論は暗号化された形(encrypted_content)で返ってくる。利用者は中身を読めないまま、次の呼び出しでそれを送り返す。
なぜこの記録が狙われるのか。OpenAIのブログはこう書いている。
保護対象の推論とは、モデルがタスクに取り組む際の内部記録です。これを抽出すると、最終回答には含まれない情報が明らかになり、第三者がモデルの能力を再現する手助けとなる可能性があります。
OpenAIは、抜き出された推論が元のモデルの安全対策を引き継がないまま別のモデルの学習に使われうること、安全に同じだけの投資をしないまま高い能力が移りうること、軍事にも民間にも使える分野であることを挙げ、国家安全保障のリスクだとしている。
暗号は破られていない
この件でまず押さえておきたいのは、OpenAIが「何が起きていないか」を明記している点だ。
The operators did not break our encryption, compromise a database, or gain direct access to stored user conversations.
(実行者らは暗号を破っておらず、データベースを侵害してもおらず、保存されたユーザーの会話に直接アクセスしてもいない)
実際にあったのは、モデルとのやり取りを操作して、隠された推論を頼んだ人に見える形で再現させることだった。ブログが挙げている例は1つで、ある会話から暗号化された推論をコピーし、別の会話でモデルに、隠された推論の中身を復号して書き起こすよう求めるというものだ。封筒を壊したのではなく、封筒を読めるモデル自身に読み上げさせた、という構図になる。
OpenAIは、この操作が使う弱点は「OpenAIのモデルに固有のものではない」とも書いている。
見出しと原文が食い違っていた
当サイトは英語版と日本語版を両方取得して突き合わせた。英語版のURLを開いても日本の環境からは日本語版に振り分けられたので、言語を英語に指定して取り直している。日付・人数・件数は、両方の版で一致していた。
一方で、報道の見出しには原文と読み方の違うものがあった。
- CyberScoop(9月30日)の見出しは「OpenAI reveals 'novel' encryption bypass used in distillation attack」(OpenAI、蒸留攻撃に使われた「新しい」暗号の回避を明かす)。原文は、暗号は破られていないと書いている
- GIGAZINE(10月1日)の見出しは「中国のAI企業が1万5000以上のユーザーを使ってモデルの思考を盗み取る蒸留攻撃を実行していた」。原文の1万5000人超は「関連するプロンプトパターンを用いた活動」のユーザー群で、OpenAI自身、全員が単一の主体に属していたかは不明としている
どちらも原文を読めば分かる違いだが、見出しだけを見た人には「暗号が破られた」「1万5000人が盗みに加わった」と伝わりうる。
「Moonshot AIの関係者」と言える範囲
誰がやったかについて、OpenAIの書き方は2つの文に分かれている。
It is unclear whether all operators we observed during the relevant time period originated from a single actor. However, we attribute a core cluster of the activity to individuals associated with Moonshot AI, the developer of Kimi.
(対象期間中に観測した実行者が、すべて単一の主体から来ていたかは不明だ。ただし、活動の中核をなす一群については、Kimiの開発元であるMoonshot AIの関係者によるものと判断している)
どうやってMoonshotだと判断したのかは、ブログには書かれていない。CyberScoopもこの点を指摘している。
OpenAI’s blog post does not cite any technical evidence or reasoning for its attribution.
(OpenAIのブログは、誰がやったかの判断について、技術的な根拠も理由も示していない)
Moonshot側の反応は、CNBCが「Moonshot did not immediately respond to CNBC’s requests for comment.」(MoonshotはCNBCの問い合わせにすぐには応じなかった)と書いている。当サイトが10月3日時点で探した範囲では、今回の件へのMoonshotの声明は見つからなかった。
Moonshotが名指しされるのは今回が初めてではない
Moonshot AIは、2026年に入って何度も蒸留をめぐって名前が挙がっている。時系列で並べる。
| 時期 | 誰が | 内容 |
|---|---|---|
| 2月23日 | Anthropic | DeepSeek・Moonshot・MiniMaxの3社が、約2万4000の不正なアカウントでClaudeと1600万回超のやり取りをしたと報告。Moonshotの分は340万回超 |
| 7月 | ホワイトハウスの高官 | Kimi K3の公開直後、MoonshotがAnthropicのFableを不正に蒸留したと非難(TechCrunch)。財務長官は、蒸留が知的財産の盗みに当たるなら制裁とエンティティ・リストへの指定も選択肢になるとXに投稿 |
| 7月21日 | Kimi側 | Kimiの企業向け事業の責任者が、K3の性能向上の核心は独自のアーキテクチャの革新で、既存モデルの蒸留ではないと回答(安全内参) |
| 7月 | OpenAI ブロックマン社長 | Bloombergのインタビューで、K3を「pretty good」と言いつつ、OpenAIのモデルの蒸留かどうかは「too early」と発言(The Next Web) |
| 9月 | Anthropic 脅威レポート | 5〜7月にMoonshotによる蒸留のやり取りを2300万回超観測。ある10日間に約30万件の利用者の質問を5,380の不正アカウント経由でClaudeに回し、答えを利用者に表示していたと記載 |
| 9月 | NSA・CISA・FBI | 共同の注意喚起でMoonshotを含む中国の6社を名指し(SecurityWeek の報道) |
| 9月30日 | OpenAI | 今回の発表 |
9月のAnthropicのレポートには、次の一文がある。
These users thought they were using a Kimi model
(これらの利用者は、Kimiのモデルを使っているつもりだった)
同じレポートは、Moonshotが推論に付く署名を保存して別のセッションで使い、推論の記録を集めていたとも書いている。OpenAIの今回の手口と考え方は近い。ただし、AnthropicもOpenAIも、それぞれ自社で起きた別の件として書いており、2つがつながっているとはどちらも書いていない。
並べてみると名指しは重なっているが、どれも告発する側の主張で、外部の第三者が確かめた結果ではない。
同じ種類の穴はClaudeとGeminiにもあった
OpenAIのブログは、独立したセキュリティ研究者からも「モデル間のやり取りや会話のコンパクションに関わる関連脆弱性」の報告を責任ある開示で受け、攻撃経路が実在することを確認したと書いている。リンク先は、2026年8月10日にarXivに出た論文「Stealing Reasoning Traces from Proprietary LLM APIs」(各社のAPIから推論の記録を盗み出す)だ。著者は、ドイツ・テュービンゲンの研究機関などに所属する8人。
論文によると、各社が推論を暗号化して返し、次の呼び出しで送り返させる仕組みには共通の弱点があった。暗号化された推論のかたまりが、同じ提供元の中で、別の会話・別のユーザー・別のモデルをまたいで使えてしまったという。要旨には「as we demonstrate across Anthropic, OpenAI, and Google」(Anthropic・OpenAI・Googleで示したように)とあり、図1には、Opus 4.8の隠された推論をより小さなHaikuに書き起こさせた結果が載っている。
研究者は公開の前に、各社とMicrosoft、Hugging Faceに知らせた。論文には「As of August 2026, the results presented in Figure 1 are no longer reproducible」(2026年8月時点で、図1の結果は再現できなくなっている)とあり、各社の対策が入ったことが分かる。元の弱点は、別の研究者(Green)が2026年5月に先に報告していたとも書かれている。
論文はこのほか、探索的な分析として、Kimi-K3やKimi-K2.5/K2.6、GLM-5.2、DeepSeekなど他社のモデルに、Opus 4.8の推論の断片を先頭に入れて反応を見ている。Kimiの名前が論文に多く出てくるのはこの分析と付録のためだ。ただし著者は、その結果について次のように書いている。
These observations are suggestive but inconclusive. They establish unusual behavioral compatibility under the interventions we test, but cannot establish a causal claim of memorization or distillation.
(これらの観察は示唆的だが決定的ではない。試した操作のもとで珍しいほど振る舞いが合うことは示せるが、記憶や蒸留という因果の主張は立証できない)
なお、この論文と7月のMoonshotの件が直接つながっているとは、論文にもOpenAIのブログにも書かれていない。当サイトが論文のテキストを検索した範囲では、Moonshot・Kimiの側に同じ穴があったという記述も見つからなかった。言えるのは、同じ種類の弱点が業界に広くあった、というところまでだ。
OpenAIの対策と、残っている2つの課題
OpenAIが挙げた対策は、大きく3つに分かれる。
- アカウント: 不正なアカウントの停止・制限、新規登録とインフラの制御の強化、関連するネットワークの監視
- 仕組み: 他のユーザーの暗号化された推論を送り直して中身を戻す経路の閉鎖、推論を露出させうるストリーミング出力を見つけて送信を保留するチェック、サードパーティーのサービス経由に移った活動はその提供者と組んで阻止
- 共有: Frontier Model Forum(AI企業の業界団体)と、政府の情報共有の経路への共有
Frontier Model Forumについては、OpenAI・Anthropic・Googleがこの団体を通じて敵対的蒸留の情報を共有していると、4月にBloombergが報じていた(Business Todayの記事による)。
ブログは「この取り組みはまだ完了していません」とも書いている。残っている課題として挙げているのは、パートナーがホストする環境(クラウド)にも自社サービスと同じ保護が必要なこと、ツール出力を介した攻撃には見える文字以外の内容まで検査する保護が必要なことの2つだ。
考察:蒸留は止められるのか
ここからは当サイトの考察で、OpenAIや各社の主張ではない。
まず、利用者への影響について。OpenAIは、保存されたユーザーの会話に直接アクセスされたわけではないと明記している。普段ChatGPTを使っている人の会話が漏れた、という話ではない。
そのうえで、蒸留を完全に止めるのは難しいと考える。理由は仕組みそのものにある。会話をサーバーに残さないために、推論を暗号化して利用者に預けている以上、そのかたまりが別の場所に持ち込まれる危険はゼロにはならない。今回ふさがれたのは「持ち込まれても中身を戻さない」道で、OpenAI自身も、敵対的蒸留の試みはさらに高度化すると予想している。
見方が分かれている点もある。The Registerは「Irony alert: OpenAI whines that Chinese model stole its special IP that it stole from everybody else」(皮肉注意。OpenAI、みんなから盗んだ自分の特別な知的財産を、中国のモデルに盗まれたと泣き言)という見出しで報じた。これに対しOpenAIで国家安全保障の政策を担当するCaroline Zier氏は、Bloombergにこう話している(The Next Webによる)。
Our concern is about violation of our terms of service, not open models or legitimate distillation.
(私たちの懸念は利用規約の違反であり、オープンなモデルや正当な蒸留ではない)
一方で、トランプ政権の元AI政策責任者のデビッド・サックス氏は、こうした報告は米国にライバルのオープンなモデルを禁止させる動きだと批判してきた(Bloombergの報道をThe Next Webが紹介)。守りの話として読むか、締め出しの話として読むかは、読み手によって分かれている。
確かなのは、隠したはずの推論を、暗号を破らずに引き出せる道があったことと、それがOpenAIだけでなくClaudeやGeminiにもあった種類の穴だったことだ。蒸留をめぐる争いは、答えだけでなく、答えに至る途中の記録まで含むものになっている。
この記事で確かめられなかったこと
- Moonshot AIの回答: 10月3日時点で、今回の件への声明は見つからなかった。回答が出たら追記する
- 誰がやったかの根拠: OpenAIのブログに記載がなく、当サイトでは確かめられない
- 米国の3機関の注意喚起の原文: 内容はSecurityWeekの報道によるもので、勧告の原文と公開日は確認していない
- Anthropicの9月のレポートの公開日: 当サイトが取得したレポート本文からは公開日を確かめられず、「2026年9月」までしか言えない
- 手口の詳細: 本記事はOpenAIのブログに書かれた範囲(概念)だけを書いている
動画では、ここに書いた流れを図にして順に説明している。Moonshot側の回答や各社の続報が出たら、この記事と動画の固定コメントの両方を更新する。
出典・参照資料
- 一次資料OpenAI「組織的なモデル蒸留活動の阻止」(2026-09-30・日本語版) ↗
- 一次資料OpenAI「Disrupting a coordinated model distillation campaign」(2026-09-30・英語版) ↗
- 一次資料OpenAI 公式ドキュメント「Reasoning models」 ↗
- 一次資料Panfilov ほか「Stealing Reasoning Traces from Proprietary LLM APIs」(arXiv:2608.09867・2026-08-10) ↗
- 一次資料Anthropic「Detecting and preventing distillation attacks」(2026-02-23) ↗
- 一次資料Anthropic「Detecting and countering misuse of AI: September 2026」 ↗
- 二次資料CNBC(2026-09-30) ↗
- 二次資料CyberScoop「OpenAI reveals 'novel' encryption bypass used in distillation attack」(2026-09-30) ↗
- 二次資料The Register(2026-09-30) ↗
- 二次資料The Next Web(2026-09-30) ↗
- 二次資料GIGAZINE(2026-10-01) ↗
- 二次資料TechCrunch(2026-07-22) ↗
- 二次資料The Next Web(2026-07-22) ↗
- 二次資料安全内参(2026-07-22) ↗
- 二次資料SecurityWeek(2026-09-09) ↗
- 二次資料Business Today(2026-04-07) ↗
この記事の解説動画
YouTubeで見る ↗大きいニュースはYouTubeでも解説しています。Xでは新着記事をお知らせしています。
コメント
まだコメントはありません。最初のコメントを書いてみませんか?
AIについて聞きたいことはありますか?
質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。
質問箱を見る →