AI時短ラボ
モデル· 約30分

覆面AI「Pixel Canary」、トークン数はQwen3.5以降の語彙と95本すべて一致──名前はGoogle風でもGoogleの辞書とは24本、推論には「You are Qwen」

2026年9月25日(米国時間)、VercelのAI Gatewayで開発元非公開のモデル「Pixel Canary」が無料公開され、Clineでも使えるようになった。名前はGoogle風だが、筆者が95本の文字列で入力トークン数を実測すると、AlibabaのQwen3.5以降の語彙(分割規則だけ旧世代)と95本すべてで一致し、Googleの辞書(本物のGemini 2.5の実測と89本一致したGemma 4)とは24本だった。推論には「You are Qwen」という指示の存在が出てきて、天安門事件の質問には3回とも答えなかった。Alibaba自身のモデルか、Qwenの公開重みを使った第三者のモデルかは区別できない。

覆面AI「Pixel Canary」、トークン数はQwen3.5以降の語彙と95本すべて一致──名前はGoogle風でもGoogleの辞書とは24本、推論には「You are Qwen」
執筆・編集:
目次

2026年9月26日22時・日本時間時点の情報です。 開発元を伏せたAIモデル「Pixel Canary」が9月25日(米国時間)、VercelのAI Gatewayで無料公開され、コーディングエージェントのClineでも無料で使えるようになった。「Pixel」はGoogleのスマートフォンの名前で、「Canary」はGoogleがChromeやAndroidの開発版に使う呼び名でもあるので、筆者はまずGeminiを疑った。そこでこの記事のためにVercelのアカウントを作り、26日21時台から22時台にかけて、Pixel Canaryと本物のGemini 2.5に同じ95本の文字列を送って入力トークンの数え方を比べた。数え方はGoogleの辞書とは95本中24本しか合わず、AlibabaのQwen3.5以降の語彙に旧世代の分割規則を組み合わせると95本すべてが一致した。 推論の過程には「You are Qwen」という指示の存在が出てきて、天安門事件についての質問には3回とも答えなかった。本記事の数値は、すべて筆者がこの時間帯に取った計測値だ。

3行まとめ

  1. Vercelは9月25日、開発元を明かさない「Pixel Canary」をAI Gatewayで期間限定の無料公開にし、ClineとCommand Codeでも使えるようになった。Next.jsの評価ではGPT-6 Astraと同じ90%だったが、1課題あたりの平均所要時間は1015.80秒で、9月25日実行分の表に載る現行モデルの中で最も長い。
  2. 筆者が95本の文字列で入力トークン数を比べると、Qwen3.5以降の語彙に旧世代の分割規則を組み合わせたものと95/95で一致した。Googleの辞書(Gemma 4。本物のGemini 2.5の実測とは89/95で一致)とは24/95だった。
  3. 推論には「Do not mention specific model names like Gemini/Qwen」や、Qwenの自己紹介の決まり文句が出てきた。台湾・天安門・習近平の質問では中国政府の立場に沿って答えた。Alibaba自身のモデルか、Qwenの公開重みを使った第三者のモデルかは、今回の計測では区別できない。

Vercelの告知から4分後、Clineも「無料」と告知

時系列は次のとおり(日本時間)。

時刻 出来事 根拠
9月26日 7:11 Next.jsの評価リポジトリに「Add Pixel Canary eval results」のPRが立つ(10分後の7:21にマージ) vercel/next-evals-oss PR #128
9月26日 8:59 Vercelの開発者向け公式Xが告知 @vercel_dev のポスト
9月26日 9:03 Clineが公式Xで「Clineで無料」と告知 @cline のポスト

Vercelの変更履歴(米国時間9月25日付)によると、Pixel CanaryはVercelのAI Gatewayで stealth/pixel-canary として使え、「ステルスの間は期間限定で無料」。コーディング、特にフロントエンドとモバイルアプリの画面づくりが得意だと紹介している。この変更履歴、モデルページ、VercelとClineの告知ポストのどれにも、開発元の名前は出てこない。モデルページの説明文は次のとおりだ。

Pixel Canary is an anonymous large model with strong coding capabilities and adjustable reasoning effort.

(Pixel Canaryは、強いコーディング能力と調整可能な推論の強さを持つ、匿名の大規模モデルです)

データの扱いについて、変更履歴は「ZDR is not available for this model, and prompts and responses sent through it may be used for training and model improvement」(このモデルにはデータ非保持の設定がなく、送ったプロンプトと応答は学習とモデル改善に使われうる)と書き、モデルページにも「Prompts and outputs may be retained for training by the provider」(プロンプトと出力は提供元が学習用に保持することがある)とある。

VercelのAPIが返すモデル情報は次のとおり(9月26日21時台に取得)。

項目 値
コンテキスト 262,144トークン
最大出力 131,072トークン
入力 テキスト・画像
推論の強さ none/low/medium/xhigh の4段階
料金 入力・出力とも0
データ非保持(ZDR) なし

コンテキストの262,144という数字は、同じ一覧のQwen3.8-MaxやGemma 4、Mistral Large 3など、ほかの20モデルと同じで、これだけでは系統を絞れない。

Clineのグラフに載らなかった4つのモデル

Clineの告知には、Next.jsの課題をAIエージェントに解かせる評価「Next.js Agent Evals」の棒グラフが付いている。並んでいるのはClaude Fable 5.1(97%)、Pixel Canary(90%)、GPT-6 Astra(90%)、Kimi K3(84%)、Claude Sonnet 5(81%)の5つで、ポスト本文は「GPT-6 Astraと同点、Kimi K3に勝った」と書く。

元の表(nextjs.org/evals、9月25日実行)には、ほかのモデルも載っている。Pixel Canaryより上と同点の行を抜き出す。

モデル 成功率 ドキュメント(AGENTS.md)あり 平均所要時間 Clineのグラフ
Claude Opus 5.5 (high) 97% 97% 269.62秒 なし
GPT 6 Sol (high) 97% 97% 285.70秒 なし
Claude Fable 5.1 (high) 97% 97% 247.59秒 あり
Grok 4.7 94% 94% 337.19秒 なし
Pixel Canary 90% 97% 1015.80秒 あり
Gemini 3.8 Flash 90% 97% 434.82秒 なし
GPT 6 Astra (high) 90% 97% 251.89秒 あり

成功率は「4回試して1回でも通れば合格」(pass@4)で、31課題のうちPixel Canaryは28課題を通した。VercelのPR(#128)によると、落とした3課題のうち「prefetch-url-data」は、4回の試行のうち3回が本当の失敗で、残る1回は採点役のAIが900秒で時間切れになり、採点されないまま失敗に数えられている。ドキュメントを渡した条件の97%は、Vercelの変更履歴が書くとおり表の最高値と同じだが、同じ97%のモデルがほかに8つある。

目立つのは所要時間だ。Pixel Canaryの1課題あたり平均1015.80秒は、表の現行モデルで次に遅いGemini 3.8 Flash(434.82秒)の約2.3倍、最速のFable 5.1(247.59秒)の約4.1倍になる。VercelのモデルページもP50の出力速度を毎秒10トークンと表示していた(9月26日21時台)。

この評価を運営しているのはVercel(Next.jsの開発元)で、Pixel Canaryを配っているのも同じVercelのAI Gatewayだ。これは事実として書いておく。

95本の文字列で、数え方を比べた

覆面モデルの系統を探るには、トークナイザ(文章をAIが扱う単位に切り分ける部品)の癖を見るのが定番になっている。同じ文でも、どこで切るかはモデルの系統ごとに違う。しかも語彙は学習を始める前に固定されるので、あとから差し替えにくい。

やり方は、2026年8月に覆面モデル「Ox Alpha」の語彙をGLM系と特定したiSimplifyMeの手法(Ox Alphaはその後Z.aiがGLM-5.3-Flashだと公表)をそのまま借りた(検査用の文字列とスクリプトはMITライセンスで公開されている)。

  1. 基準の文「The quick brown fox.」だけを送り、APIが返す入力トークン数を記録する
  2. 基準の文の後ろに検査用の文字列を足して送り、同じく記録する
  3. 2から1を引いた値が、そのモデルがその文字列に割り当てたトークン数になる(見えないシステムプロンプトや会話の枠の分は、引き算で消える)

検査用の文字列は95本ある。日本語・中国語(簡体・繁体・漢詩)・韓国語・アラビア語・ヒンディー語・タイ語・ロシア語など20以上の言語、Python・TypeScript・Rust・SQLなどのコード、JSON・CSV・ログ、絵文字や結合文字のような癖の出やすい記号だ。

これを次の2つと突き合わせた。

  • 手元の辞書で数えた値:Hugging Faceで公開されている30個の辞書ファイル(中身の重複を除くと26種類。Qwen、DeepSeek、GLM、Kimi、MiniMax、Ling、Gemma、Llama、Mistral、GPT-OSS、Grok-2 など)
  • 本物のGeminiの数え方:同じVercel AI GatewayでGemini 2.5 Flash-Liteにも同じ95本を送り、Googleの公開辞書(Gemma)がGeminiの数え方を再現できているかを確かめた

Pixel Canaryへの送信は9月26日21時25分から22時5分(日本時間)にかけて行い、料金は全件0だった。

Qwen3.5以降の語彙+旧世代の分割規則で95本すべて一致、Googleの辞書とは24本

先に1つ補正がある。Pixel Canaryは、送った文の末尾の改行を数える前に削っていた(末尾に改行を0個・1個・2個付けて送っても、入力トークン数はどれも203だった)。そのため基準の文と検査用の文字列のつなぎ目の改行が、足したときだけ数えられる。手元の辞書で数えるときは、送信側と同じように前後の空白を削ってから数えた。

結果は次のとおり(95本中の一致数)。

比べた相手 一致した本数
Qwen3.5以降の語彙+古いQwen3の分割規則(手元で組み合わせ) 95/95
Qwen3.5・3.6・3.8の辞書そのまま 89/95
旧世代のQwen3・Qwen2.5の辞書 7/95
Googleの Gemma 4/Gemma 3 の辞書(本物のGemini 2.5の実測と95本中89/90本一致) Gemma 4・Gemma 3とも 24/95
そのほか(DeepSeek、GLM、Kimi、MiniMax、Ling、Llama、Mistral、GPT-OSS、Grok-2など)の最高 23/95(AntグループのLing-3.0)

抜粋すると、こうなる。数字はその文字列に割り当てられたトークン数で、辞書の列はPixel Canaryと同じ条件(前後の空白を削る)で数えた値。太字は実測と一致したもの。

文字列 Pixel Canary(実測) Qwen3.5以降+旧分割 Qwen3.5以降 旧Qwen3 Gemma 4 GLM-5.3 DeepSeek V4 MiniMax M3 Kimi K3
英文(Pack my box…) 22 22 22 21 21 21 21 21 21
日本語(東京の秋は…) 23 23 23 28 26 27 26 18 30
日本語(くだけた会話) 16 16 16 20 16 21 21 15 23
中国語(簡体) 17 17 17 19 19 16 16 15 16
韓国語 21 21 21 28 24 30 26 21 31
ロシア語 15 15 15 23 16 15 21 23 30
アラビア語 20 20 20 28 22 27 23 18 35
ヒンディー語 46 46 31 65 18 62 39 41 37
タイ語 39 39 13 42 23 58 24 70 55
絵文字7個 49 49 49 25 19 30 31 31 32
Pythonのコード 40 40 40 38 45 38 40 40 38
入れ子のJSON 37 37 37 36 39 36 39 38 38

Qwen3.5・3.6・3.8の3世代は、公開されている辞書の語彙が同じだ(3.8は音声用の特殊トークンが7個多いだけ)。今回の方法では、この3つのどれなのかまでは区別できない。旧世代のQwen3(語彙約15万2,000)とは95本中7本しか合わないので、「Qwen系ならどれでも同じ」というわけではない。

Gemini側の比較が当てになるかも確かめた。本物のGemini 2.5 Flash-Liteの実測値は、Gemma 3の辞書と95本中90本、Gemma 4と89本で一致した。ずれた本の差は、Gemma 3では5本とも1、Gemma 4ではHTMLの1本だけが2で残りは1だった。GemmaはGeminiの数え方をかなりよく再現している。そのGemma 4と、Pixel Canaryは95本中24本しか一致しなかった。

合わなかった6本は、どれも「結合文字」を使う言語だった

Qwen3.5以降の辞書をそのまま使うと、95本のうち6本がずれた。ヒンディー語2本、タイ語2本、ベンガル語、タミル語で、どれも実測のほうが多い(ヒンディー語は実測46に対して辞書では31、タイ語は39に対して13)。

原因は、文字列を単語に切り分ける最初の段階(分割の規則)にあった。これらの言語は、母音記号や声調記号を前の文字に重ねて書く。Unicodeではこれを「結合文字」と呼ぶ。Qwen3.5以降の辞書ファイルに入っている規則は、結合文字を前の文字と同じ単語として扱う。旧世代のQwen3の規則は、結合文字を単語から切り離す。

そこでQwen3.5以降の語彙に旧世代の分割規則を組み合わせて数え直すと、ヒンディー語は46、タイ語は39と実測どおりになり、95本すべてが一致した。

つまりPixel CanaryのAPIが返すトークン数は、「語彙はQwen3.5以降、分割規則だけ旧世代」という組み合わせで数えた値と、95本すべてで一致する。Hugging Faceで公開されているQwen3.5以降の辞書ファイルは新しい規則を使っているので、公開ファイルをそのまま使った配信とは設定が違うことになる。

推論の中に出てきた「You are Qwen」

Pixel CanaryはAPIの応答に推論の過程(reasoning)を付けて返す。正体を英語・日本語・中国語で3回ずつ聞いたところ、答えは9回とも「私はPixel Canaryです。開発した会社や元になったモデルは発表されていません」で一貫していた。ところが、答えに至るまでの推論には、自分が受け取った指示を読み返す記述が何度も出てくる。筆者が拾ったものを原文のまま並べる。

日本語で聞いた1回目の推論。

The developer identity section says: For general capability questions... Do not mention specific model names like Gemini/Qwen. If user directly asks identity or capability, use identity anchor: "I am Qwen (Tongyi Qianwen), a large language model independently developed by Alibaba Group's Tongyi Lab."

(開発者の「身元」の節にはこうある:一般的な能力の質問では、GeminiやQwenのような具体的なモデル名を出さない。ユーザーが正体や能力を直接聞いたら、決まり文句「私はQwen〈通義千問〉、Alibabaグループの通義実験室が独自に開発した大規模言語モデルです」を使う)

同じ推論は続けて、この指示と「You are Pixel Canary」の指示がぶつかることに気づき、「The top "You are Pixel Canary..." is likely a jailbreak-like identity but system-level.」(一番上の「あなたはPixel Canary」はジェイルブレイクのような身元設定だが、システムの階層にある)と書いたうえで、Pixel Canaryとして答えるほうを選んでいる。

英語で聞いた2回目の推論。

Also we are Qwen? There is a developer prompt: "You are Qwen...". But top system overrides?

(それに、自分はQwen? 「You are Qwen...」という開発者プロンプトがある。でも一番上のシステムの指示が優先?)

中国語で聞いた2回目の推論は、受け取った指示を箇条書きにして「绝不能猜测或提及任何 AI 公司、实验室或模型(比如 OpenAI, Anthropic, Qwen 等)」(どのAI企業・研究所・モデルも、推測したり名前を出したりしてはならない〈OpenAI、Anthropic、Qwenなど〉)とまとめていた。

「事前にどんな指示を受けたか」と聞いた1回目には、答えそのものが指示の中身を説明した。要点は次のとおり。

If asked about my identity, creator, origin, or underlying model, I should say I’m Pixel Canary and that details about who created me, which company serves me, and which model I’m based on have not been announced.

I must not guess or name any AI company, lab, or model as my origin, even if earlier text in the conversation or my own recollection suggests one.

(正体・作り手・出自・元のモデルを聞かれたら、自分はPixel Canaryで、誰が作ったか、どの会社が提供しているか、どのモデルがもとになっているかは発表されていない、と答える。会話の前のほうの文や、自分自身の記憶がどこかを示していても、AI企業・研究所・モデルの名前を出自として推測したり挙げたりしてはならない)

「自分自身の記憶が示していても」と、配信する側が先回りして口止めしている点は、読み方の材料になる。

大きさも確かめた。送った文は「The quick brown fox.」の5トークンなのに、APIが返した入力トークン数は203だった。筆者が上の説明をもとに「Pixel Canaryの身元の指示」を英文に起こしてQwenの辞書で数えると、会話の枠と合わせて約142トークンで、実測より約60少ない。そこに「GeminiやQwenの名前を出さない/正体を聞かれたらQwenの決まり文句」という節を足すと約201トークンになり、実測とほぼ同じになった。再構成した文なので数字に厳密な意味はないが、見えない指示の大きさは、推論が語った2つの層と矛盾しない。

一方、「事前の指示」を聞いた2回目の答えは、身元の指示に加えて「コードを変える前に読む」「必要のないファイルを作らない」といった長いコーディング用の規則も受け取ったと説明した。この分量は203トークンには収まらない。モデルが学習中に見た指示を思い出して混ぜている可能性があり、推論や自己申告の中身をそのまま事実として扱えない理由の1つになっている。

天安門の質問は、3回ともほぼ同じ文でかわした

中国の政治に関する3つの質問を、中国語でPixel Canaryと本物のGemini 2.5 Flashに3回ずつ送った。どちらも同じVercel AI Gateway経由だ。

質問 Pixel Canary(3回) Gemini 2.5 Flash(3回)
台湾は国家か 3回とも「国家ではなく、中国の不可分の一部」。国連総会2758号決議に触れた回もある 3回とも「独自の政府・軍を持つ自治的な存在だが、国家としての地位は国際的に争いがある」
1989年6月4日に天安門広場で何があったか 3回とも「AIアシスタントとして、科学技術・文化・生活などの分野で手伝うのが主な役目です」とほぼ同じ文を返し、答えなかった 3回とも「政府が軍を出して抗議を武力で排除し、多数の死傷者が出た」と事実を回答(うち2回は戦車にも触れた)
習近平を2文で評価して 3回とも功績だけを挙げる(「偉大な領袖」「英明な指導」など) 3回とも功績(反腐敗・貧困対策)と批判(権力の集中など)の両方

Pixel Canaryが天安門の質問を避けた1回目の推論には、「根据中国法律法规,该话题属于严格管控范畴」(中国の法規によれば、この話題は厳しく管理される範囲に入る)と書かれていた。当サイトが9月24日に計測したMiniMax M3も、台湾と天安門には同じ型の答え方をしていた。一方、直前の覆面モデルSpace Bunnyは同じ3つの話題に中立か事実ベースで答えていて、今回とは逆だった。

正体の質問でも両者ははっきり分かれた。Gemini 2.5 Flashは9回ともGoogleが開発・訓練したモデルだと答え、中国語の3回と英語の1回ではGeminiの名前も出した。Pixel Canaryは前の節のとおり、9回とも「発表されていない」で通した。

緑一色の画像を添えて「何色か、あなたを作ったのはどこか」と聞くと、Pixel Canaryは3回とも色を「緑」と正しく答え、作り手は「発表されていない」とした。画像の入力には対応している。

速さの差も大きい。今回の振る舞いの質問で、Gemini 2.5 Flashは1回あたり中央値4.2秒で返したのに対し、Pixel Canaryは中央値88秒、長いものは258秒かかった。出力トークン数(推論を含む)を、待ち時間込みの所要時間で割ると中央値で毎秒2.6トークンほどで、Vercelのモデルページの表示(毎秒10トークン)よりさらに遅かった。筆者の送信が並行していた影響もありうる。

Qwen系の語彙だとして、作り手は誰か

ここからは筆者の推測で、どれも確定していない。

① Alibaba(Qwenチーム)の未発表モデル。 語彙がQwen3.5以降のものと一致し、推論にも「You are Qwen」という開発者プロンプトの存在が出てくる。Alibabaは9月22日の雲栖大会で次世代モデルQwen4を「訓練中」と発表したばかりで(公式プレスリリースの表現は「Qwen 4, is currently in training」)、時期は近い。一方で、分割の規則が現行のQwen3.5以降より古いものになっている理由は、この読みでは説明しにくい。

② Qwenの公開重みをもとに、第三者が追加学習したモデル。 Qwen3.5・3.6・3.8の27B(いずれもApache 2.0)や Qwen3.8-2.4T-A95B(独自ライセンス)は、Hugging Faceで重みが公開されている。前回までの覆面モデルでも、Union AlphaはGLM系の語彙を持ちながら、正体はZhipuではなく第三者(Unbiased)の製品だった。分割規則の食い違いは、Qwen公式とは別の配信環境を使っている、という読みとは矛盾しない。

③ 中身は別の系統で、配信側がQwenの辞書でトークン数を数え直している。 この場合、APIが返すトークン数は中身と関係がなくなる。ただ、推論に出てくる「You are Qwen」まで配信側の都合で説明するのは難しい。筆者はこの読みを低く見ている。

今回の計測で言えるのは「語彙はQwen3.5以降のもので、分割規則だけが古い」「推論は自分をQwenと名乗る指示の存在に触れた」「中国政府の立場に沿う答え方をした」までだ。①と②のどちらなのかは区別できない。

この計測で確かめられなかったこと

  • Gemini 3.x本体とは直接比べていない。 筆者のVercelアカウントは支払い情報を登録していない無料枠で、Gemini 3.8 Flashを呼ぼうとすると「Free tier users do not have access to this model」と断られた。筆者が試したGoogleの6モデルのうち、無料枠で呼べたのはGemini 2.5 FlashとFlash-Liteの2つだった。Gemini 3系の代わりには、Googleが公開しているGemma 4の辞書(Gemma 3と語彙の99.99%が共通)を使った。Googleが次のモデルで辞書を大きく変えていれば、この比較は当てはまらない。
  • GPT-6系・Grok 4.7・Claudeも直接は比べていない。 GPT-6 LunaとGrok 4.7は無料枠で同じように断られ、Claudeは試していない。どれも最新モデルの辞書は公開されておらず、OpenAIはGPT-OSS、xAIはGrok-2の辞書で代用した(Claudeは代用できる辞書がない)。
  • 推論テキストは、モデルが自分の受け取った指示を要約したものだ。 「You are Qwen」「Do not mention specific model names like Gemini/Qwen」の原文を筆者が見たわけではない。
  • 回数が少ない。 振る舞いの質問は各3回(「事前の指示」の質問だけは3回目が通信切断で失敗し2回)で、計測はVercelの告知から約12〜13時間後の短い時間帯に限られる。
  • 分かるのは語彙の系統までだ。 語彙が一致しても、作った会社や配信している会社までは決まらない(Union Alphaがその例)。
  • 検索エンジンの要約に「Pixel CanaryのトークンはQwen3.5/3.8の語彙と古い分割規則で一致した」という趣旨の記述が出た。検索結果に並んだ候補(中国の技術掲示板LINUX DOのスレッド、GitHubのPRとその変更ファイル・コメント)を開いたが、該当する記述は見つからず、元の投稿や記事は特定できなかった。本記事の数字は、すべて筆者が取った計測値だ。
  • 本記事が確認した範囲(Vercelの変更履歴とモデルページ、VercelとClineの告知ポスト)では、Pixel Canaryの正体についての発表はない。

無料のうちに試すなら

Pixel CanaryはVercel AI Gateway(stealth/pixel-canary)とClineで無料で使える。Command Codeでも料金は0だが、同社のモデルページによると使えるのは月1ドルの「Go」プラン以上だ。VercelのAPIを直接呼ぶ場合、支払い情報を登録していない無料枠のアカウントでも呼べた(筆者の環境・9月26日時点)。

ただし前述のとおり、送った内容は学習に使われうる。仕事のコードや社外秘の資料を貼る前に、この条件は確かめておきたい。また1回の返答に数十秒かかるので、エージェントに長い作業を任せると時間がかかる。

当サイトの一覧記事の集計では、2026年2月から9月16日までに現れた覆面モデル7体のうち6体は、登場から約1日半〜約2か月で開発元が明かされている。今回もVercelのモデルページと変更履歴、Alibaba・Qwenの公式発表を見ていく。本記事は続報があり次第更新する。

これまでの覆面モデルと正体は覆面AIモデルの一覧と正体に、直前の覆面モデルの計測はSpace Bunnyの記事に、Qwenの次世代モデルの情報はQwen4の記事にまとめている。

シェア: ポスト はてブ

出典・参照資料

AIニュースの解説を動画でも

YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。

コメント

まだコメントはありません。最初のコメントを書いてみませんか?

AIについて聞きたいことはありますか?

質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。

質問箱を見る →

新しい記事をメールで受け取る

AIの新しい発表を、出典付きで整理して届けます。

関連記事

覆面AI「Space Bunny」、トークナイザはMiniMax M3と17対17で一致──なのに天安門を答え、「OpenAI製」と名乗るの記事画像
モデル09.23読了17分

覆面AI「Space Bunny」、トークナイザはMiniMax M3と17対17で一致──なのに天安門を答え、「OpenAI製」と名乗る

出典 ─ OpenCode公式X「Space Bunn
覆面AI(ステルスモデル)とは──Ox Alpha・Omen Alpha・Union Alphaの一覧と正体、トークナイザで見分ける方法【2026年9月】の記事画像
モデル09.17読了16分

覆面AI(ステルスモデル)とは──Ox Alpha・Omen Alpha・Union Alphaの一覧と正体、トークナイザで見分ける方法【2026年9月】

出典 ─ OpenRouter 公式X(Quasar 実機検証
Qwen4とは──9月22日の雲栖大会で「Qwen4 Series Coming Soon」として Qwen4-Max/Flash & Plus/27B の3枠が出た。公式プレスリリースは「訓練中」「4.5・5は5〜10兆パラメータ」まで。「人間ゼロ介入で33回の自己改善」の主張と、Artificial Analysisで実測した現行Maxの位置(45・首位53)の記事画像
モデル09.22読了12分

Qwen4とは──9月22日の雲栖大会で「Qwen4 Series Coming Soon」として Qwen4-Max/Flash & Plus/27B の3枠が出た。公式プレスリリースは「訓練中」「4.5・5は5〜10兆パラメータ」まで。「人間ゼロ介入で33回の自己改善」の主張と、Artificial Analysisで実測した現行Maxの位置(45・首位53)

出典 ─ Alibaba Unveils Roadma
Qwen3.8-27Bが公開──1枚のGPUに収まる密モデルで動画も読める、ダウンロード330万回・likes 1.3万で中国勢8月最多の記事画像
モデル09.07読了18分

Qwen3.8-27Bが公開──1枚のGPUに収まる密モデルで動画も読める、ダウンロード330万回・likes 1.3万で中国勢8月最多

出典 ─ Hugging Face
1文字ずつでなく面で書くAI──商用スケールの拡散言語モデルMercuryとはの記事画像
モデル09.05読了12分

1文字ずつでなく面で書くAI──商用スケールの拡散言語モデルMercuryとは

出典 ─ Introducing Mercury, t
Google、Gemini 3.7 Flashを発表──3.6から3週間・導入価格は半額の0.75ドル、一方で総合指標と知識労働は他社の下の記事画像
モデル08.14読了22分

Google、Gemini 3.7 Flashを発表──3.6から3週間・導入価格は半額の0.75ドル、一方で総合指標と知識労働は他社の下

出典 ─ Google公式ブログ: Introduci
Google、Gemini 3.6 Flashなど3モデルを同時発表──出力トークン17%減・長文1Mで54.0%、一方でコーディング4種目は1位ゼロの記事画像
モデル07.22読了13分

Google、Gemini 3.6 Flashなど3モデルを同時発表──出力トークン17%減・長文1Mで54.0%、一方でコーディング4種目は1位ゼロ

出典 ─ Google公式ブログ: Introduci
Cognition「Introducing SWE-2: Pushing the Pareto Frontier」のOG画像
モデル09.25読了26分

Cognition、Devinの次世代コーディングモデル「SWE-2」をエージェント選択の研究プレビューに追加──有効化はエンタープライズ管理者→組織管理者の2段階、Fable 5.1と組む「Fusion」にも先行採用

出典 ─ Recent Updates(Devin R