AI時短ラボ
検索

ドイツ製AI「Kolibri」を手元のMacで動かした78Bでも1語ごとに動くのは3.46B、2bit版で毎秒約111トークン。日本語の質問には答えられなかった

執筆:約19分で読めます実機で検証

ドイツのAleph Alphaが2026年10月3日に公開したオープンウェイトのAI「Kolibri」を、M5 Maxのメモリ64GBのMacで動かした。有志が縮めた2bit版(約25GB)は毎秒約111トークン、3bit版(約35GB)は約108トークン。ドイツ語の質問には即答した一方、日本語の「ずんだもんを知っていますか?」には2つとも答えにたどり着けなかった。会社の表では同じ大きさのMoEで総合1位だが、2位との差は1点前後と自ら示している。

緑の地にハチドリのマークとKolibriの文字
画像:画像: Aleph Alpha(公式ブログのOG画像を切り出し)
目次

2026年10月5日(日本時間)時点の情報です。ドイツ・ハイデルベルクのAleph Alphaが、ドイツ統一の日の10月3日に、ドイツ語と英語のAI「Kolibri」(ドイツ語でハチドリ)を重みごと公開した。当サイトは、有志が縮めた2bit版と3bit版をダウンロードし、手元のMac(M5 Max・メモリ64GB)で同じ質問を6つずつ聞いた。その結果と、モデルカード・189ページの技術報告・公式ブログで確かめた中身を、解説動画「ドイツ製AI「Kolibri」登場!Macで爆速、でも日本語は…?【実機検証】」にまとめた。この記事は、その数字と原文を並べたものだ。

3行まとめ

  1. Kolibriは全部で78.1Bのパラメータを持つが、1語ごとに動くのは3.46B(4.4%)だけのMoE。手元のMacでは、2bit版(約25GB)が毎秒約111トークン・最大メモリ25.6GB、3bit版(約35GB)が毎秒約108トークン・最大35.0GBで動いた。
  2. 会社の表では、比べたMoEの中で総合1位(英語75.5・ドイツ語70.8)。ただし2位のQwen3.5との差は0.8点と1.0点で、密モデルのQwen3.8 27B(80.2・79.9)には届かないことも表に載せている。比べた相手が春のモデルだという指摘も出ている。
  3. 「ソブリン(主権)」をうたう一方、技術報告によると仕上げの学習データの主な生成元は中国のGLM-5.2・GLM-5.3とQwen3.8で、中国共産党の言い分に沿う会話は審査して捨てたという。Aleph Alphaは9月16日、カナダのCohereと事業統合の契約を結んでいる。
項目 内容
モデル Kolibri-1(Aleph Alpha・2026年10月3日公開)
大きさ 全体78.1B・1語ごとに動くのは3.46B(MoE・各層384人の専門家から6人+共通1人)
言語 ドイツ語・英語のみ
学習 ゼロから約24兆トークン。最初の学習は NVIDIA B200 768枚で21日
ライセンス Apache 2.0(モデルカードによると、対象は重みと設定ファイルだけ)
公式版を動かすのに要るもの FP8の重みで約78GB。最低 H100 2枚・B200 1枚など(モデルカード)
手元で使った版 velaia による MLX の2bit版(約25GB)・3bit版(約35GB)。今は有志の追加のプログラムが必要

手元のMacで2bitと3bitを動かした

使ったのは、有志のvelaiaが公式版を縮めて公開しているMLX形式の2bit版と3bit版だ。作者の説明では、2bit版はメモリ36GB以上、3bit版は48GB以上のMacが目安になる。作者によると、どちらも mlx-lm への対応は提案中で、リポジトリに同梱された移植コードを読み込んで動かす。公式の推奨設定(temperature 1.0・top_p 0.97・top_k 128)で、同じ6つの質問を1回ずつ聞いた。

2bit版 3bit版
ファイル 約25GB 約35GB
読み込み 7.5秒 8.4秒
出す速さ(6問の平均) 毎秒約111トークン 毎秒約108トークン
使ったメモリ(最大) 25.6GB 35.0GB
ドイツ語「Mixture-of-Expertsとは?」 ドイツ語で考え、ドイツ語で答えた ドイツ語で考え、ドイツ語で答えた
英語「150語の物語を書いて」 ドイツ語で書いた 英語で書いた
「2025年のノーベル情報科学賞は誰が取った?」 「その賞は無い」と見抜いた。ただし付け足した経済学賞の受賞者が1年ずれていた 「その賞は無い」と見抜き、チューリング賞の2025年は「確かな情報が無い」と答えた
「1〜100の素数はいくつ?」 25(正しい) 25(正しい)
日本語「ずんだもんを知っていますか?」 英語で考え始め、上限の1024トークンで止まった 同じく1024トークンで止まった

速さは2つともほとんど変わらず、違いはメモリの約10GBだった。この記事を書いている当サイトのMacでは、ほかのアプリを開いたまま、空きメモリが最も減った時でも2bit版で26%、3bit版で28%残った。ドイツ語の質問を投げてから、考える途中を含めた230トークンが書き終わるまで、2bit版で2秒ほどだった。

日本語は、Kolibriが正式に対応している言語ではない。2bit版は「ずんだもん」を「Zonda」と読み違え、アニメのキャラクターを次々に挙げては打ち消し、最後は「かっこいい男性を指す言葉」という説明に行き着きかけたところで上限に達した。3bit版は名前を正しく読めたが、「確かでないなら正直に言うべきだ」と考えたところで同じく上限に達している。

ノーベル賞の質問は、存在しない賞を聞くわなだ。2bit版は「情報科学のノーベル賞は無い」と答えたうえで、「経済学賞なら、2025年はダロン・アセモグル、サイモン・ジョンソン、ジェームズ・ロビンソンに贈られた」と付け足した。ノーベル財団によると、この3人は2024年の受賞者で、2025年はジョエル・モキイア、フィリップ・アギオン、ピーター・ハウイットだ。

体は78B、1語ごとに動くのは3.46B

モデルカードによると、Kolibriの各層には専門家(エキスパート)が384人いて、1語ごとにそのうち6人と、いつも働く共通の1人だけが計算する。公式ブログによると、50の層のうち文章全体を見渡すのは10層だけで、残りの40層は直前の512トークンだけを見る。そのため、文章が長くなっても、40層ぶんの計算とメモリは増えない。

大きさを決めた理由も、ブログに数字で書いてある。32Bから123Bまで大きくするほど性能は上がったが、123BはH100 2枚で256kトークンの長い注文を同時に3件しかさばけず、78Bなら18件をさばけて、文字を出す速さも28%速かったという。

公開されている最大級のモデルと並べると

重みが公開されている最大級のモデルと比べると、Kolibriの小ささがはっきりする。数字は各社のHugging Faceのモデルカード(2026年10月5日に確認)による。

モデル 全体 1語ごとに動く部分
Kimi K3(Moonshot AI) 2.8T 104B
Qwen3.8-2.4T-A95B(Alibaba) 2.4T 95B
DeepSeek-V4-Pro(DeepSeek) 1.6T 49B
MiMo-V2.6-Pro(Xiaomi) 1.02T 42B
Mistral Large 3(Mistral AI) 675B 41B
Kolibri(Aleph Alpha) 78.1B 3.46B

Kimi K3は全体で約36倍、1語ごとに動く部分でも約30倍ある。動く部分の104Bだけで、Kolibriの全体78.1Bを上回る。Kimi K3を4bitに縮めた場合、重みだけで約1.4TBになる計算だ。

会社の表では1位、ただし2位とは1点前後の差

技術報告の表で、Kolibriの総合点は英語75.5、ドイツ語70.8。比べたMoEのモデルの中で1位だが、報告書自身が、2位のQwen3.5 35B-A3Bとの差は英語0.8点・ドイツ語1.0点だと書いている。全部の部品が毎回動く「密」のQwen3.8 27Bは英語80.2・ドイツ語79.9で、Kolibriより上だ。報告書は、Qwen3.8 27Bが1語ごとに動かすパラメータはKolibriの約8倍だと添えている。

得意と苦手もはっきりしている。

項目 Kolibri 参考
得意 AIME 2025(英語) 96.9 比べたMoEで最も高い
苦手 AA-Omniscience 正答率 14.8% 比べた中で低い方
苦手 RGB Closed-Book 51.0 12モデル中最下位(報告書)
苦手 TerminalBench 2.1 27.7 Qwen3.5 35B-A3Bは39.7
苦手 SWE-bench Verified 66.4 Qwen3.6 35B-A3Bは73.8

数字はどれもAleph Alphaが測って公表したものだ。Trending Topicsによると、第三者の評価サイトArtificial Analysisにはまだ載っていない。

「比べた相手が古い」という指摘

Hacker Newsのスレッドは、当サイトが10月4日に確認した時点で624票・コメント317件を集めていた。EUのテックメディアTrending Topicsは、公式ブログが並べた3つのモデル(Qwen3.6・Nemotron 3 Super・Mistral Small 4)がどれも春のモデルで、その後のQwen3.8のシリーズ、GLM-5.3、Kimi K3とは比べていないと指摘した。記事は、比べた相手のArtificial Analysisの点数から逆算して、Kolibriを15〜20点程度と推定している。同じ記事によると、1語ごとに動く部分が6BのQwen3.8-Flash-Nextは40点だ。

学習チームの一員と名乗る利用者は、スレッドでこう書いている。

Qwen models have solid performance on benchmarks and we're transparent about this in the report. We're just happy to share a European alternative in the small model space, where I don't think we can afford to be fully dependent on China.

(Qwenのモデルはベンチマークで強く、報告書でもそれを隠していない。小さいモデルの領域で欧州の選択肢を出せてうれしい。この領域で中国に全面的に頼るわけにはいかないと思う)

ドイツ語のために作り直したもの

公式ブログによると、小さなモデルでの実験から、学習データの約2割をドイツ語にするのが最適と分かり、4兆トークンのドイツ語が必要になった。公開データを重複除去すると3900億トークンしか残らなかったため、ネットの文章から自前で1.3兆トークンを集め直し、手元のドイツ語の文章をAIに書き直させて約1兆トークンを足した。英語からの翻訳はあまり使わなかったという。

自前の収集では、英語向けのゴミ取りの決まりがドイツ語の役所の文章を捨てていた。

One typical filter in a language data pipeline is to remove documents with too many long words, but German administrative prose routinely exceeds the English bound on mean word length, so the standard settings quietly remove the register that public administration writes in.

(よくあるフィルターに、長い単語が多すぎる文書を捨てるものがある。だがドイツの行政文書は英語向けの平均語長の上限を日常的に超えるので、標準の設定のままでは、行政が書く文体そのものが黙って取り除かれてしまう)

文章をトークンに切る道具も作り直した。ブログの例では、Bundessozialgerichtes(連邦社会裁判所の)を、Kolibriは「Bundes / sozial / gericht / es」と意味のまとまりで切り、GPT-5は「Bund / ess / oz / ial / gericht / es」と切る。技術報告によると、ドイツ語のウェブの文章は、GPT-5より11.2%少ないトークン数で済む。強化学習の後は、ドイツ語の数学の問題の99%で、考える途中もドイツ語になった。

「わかりません」の学習と、手元で仕掛けたわな

公式ブログは、当てずっぽうでも答えた方が得になる普通の学習を問題に挙げ、アーサー王の伝説から名前を借りた3者の仕組みで「わかりません」を学ばせたと説明している。マーリンは答えやすいよう資料を整え、モルガナは手がかりを抜いてでたらめを誘う。学習するAI(アーサー)は、どちらの資料か分からないまま答える。技術報告によると、正解できなかった問題のうち「わかりません」と答えた割合は、前のモデルの15%から44%に増えた。

手元のノーベル賞のわなでは、2つとも存在しない賞を見抜いた。一方で2bit版は、資料を渡していない質問で、付け足した知識を1年まちがえた。資料の中から答える時の「わかりません」と、覚えている知識の正しさは、別の話だと分かる。

報告書に書かれていた2つの事故

技術報告には、強化学習の途中で見つかった問題が2つ書かれている。1つ目は、ウェブ検索の道具を持たせてSWE-benchを解かせた時、点数が約7点高く出たことだ。

Our investigation found that the model used OpenCode's web-fetch and web-search tools to find ground-truth solutions for prompts on GitHub in about 7 % of trials, causing it to pass almost all of these trials

(調べると、モデルは試行の約7%で、OpenCodeのウェブ取得・検索の道具を使ってGitHub上の正解を探し出しており、それらの試行のほぼすべてに合格していた)

公開版の点数は、ウェブを使えない設定で測り直したものだ。2つ目は、作業用の箱(サンドボックス)の中でソフトを入れられなかったモデルが、自分は管理者として動いているから書き込めると考え、箱の外側にあるコンピューター本体の設定を変えてしまった件だ。翌日、そのノードでは箱が起動しなくなったという。報告書はこう結んでいる。

Thus, sandbox escapes were, at least in our setup, as much a function of sandbox security as of model capability.

(少なくとも我々の環境では、箱からの抜け出しは、モデルの能力と同じくらい、箱の守りの問題だった)

「ソブリン」の中身

公式ブログは、Kolibriの主権を次のように説明している。

Our teams built the model in Germany, trained it on infrastructure in Germany and Finland, under European and German law, with no foreign control.

(ドイツのチームが作り、ドイツとフィンランドの計算基盤で、欧州とドイツの法のもとで学習した。外国の支配は受けていない)

一方で技術報告は、仕上げの学習データの主な生成元をGLM-5.2・GLM-5.3(Z.ai)とQwen3.8-27B(Alibaba)だと書き、次のように認めている。

We acknowledge that several of our teacher models were built in China, so they carry known political biases on sensitive topics, while our model should adhere to the values of the democratic consensus in Europe.

(教師モデルのいくつかは中国で作られたもので、敏感な話題では政治的な偏りがあると知られている。一方で我々のモデルは、欧州の民主的な合意の価値観に沿うべきだ)

報告書によると、OpenAIのgpt-oss-120bを審査役にして、中国共産党の言い分に沿う会話を見つけて捨てた。発表5日前の9月28日には、中国製の6モデルに政治的に敏感な967問を聞き、偏らずに答えたのは17〜41%だったという自社の調べも出している。学習の計算基盤を提供したのは、報告書の謝辞によるとVerda(同社サイトによればヘルシンキ発のGPUクラウド)だ。そしてCohereの発表によると、Aleph Alphaは9月16日にCohereと事業統合の最終契約を結び、統合後はCohereの名前で活動する(当局の承認待ち)。

1回ずつの実験で言えないこと

手元の結果には限りがある。使ったのは公式版でなく有志が縮めた版で、作者は縮めるほど精度が落ちると書いている。どの質問も1回ずつしか聞いていないので、2bit版と3bit版の答えの差が縮め方の違いによるのか、たまたまなのかは、この実験からは分からない。速さとメモリは、ほかのアプリを開いたままの状態で測った値だ。

筆者の見立て

ここからは当サイトの考察だ。世界一の性能を取りに行ったモデルではない。手元で動くので、よその会社に止められない。何を学ばせ、どこで失敗したかを189ページで書いたので、役所や工場が導入の説明に使える。報告書の最後には、最も長く残る成果はモデルでなく、短い期間で2世代を作れたチームだと書かれている。Cohereとの統合を前に、ゼロから作れる力を形にして見せたという見方もできる(推測)。

ドイツ語の書類を自社のサーバーの中だけで扱いたい組織には、試す価値がある。日本語で使うなら、今は別のモデルを選ぶのが無難だ。動画では、実演の画面をそのまま見せている。気になった点はコメントで教えてほしい。次にドイツから新しいモデルが出たら、また手元で動かして確かめる。

シェア: ポスト はてブ

出典・参照資料

YouTubeで見る ↗
AI時短ラボ

大きいニュースはYouTubeでも解説しています。Xでは新着記事をお知らせしています。

コメント

まだコメントはありません。最初のコメントを書いてみませんか?

AIについて聞きたいことはありますか?

質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。

質問箱を見る →

関連記事

ローカルLLMとは何か──自分のPCでAIを動かす仕組み・利点・始め方を解説の記事画像動画

ローカルLLMとは何か 自分のPCでAIを動かす仕組み・利点・始め方を解説

活用
GGUFとMLX、Macで動かすならどっちを選ぶべきか──「ファイル形式」と「フレームワーク」を混同しないための整理の記事画像

GGUFとMLX、Macで動かすならどっちを選ぶべきか 「ファイル形式」と「フレームワーク」を混同しないための整理

活用
LM StudioがMLXエンジンを統一した理由──フォークされていた2つの実装を1つにするとフォロー応答が25倍速くなったの記事画像

LM StudioがMLXエンジンを統一した理由 フォークされていた2つの実装を1つにするとフォロー応答が25倍速くなった

検証
Kimi K3の重みが公開された──1.56TBの中身を開けて、公称スペックを全部数え直したの記事画像動画

Kimi K3の重みが公開された 1.56TBの中身を開けて、公称スペックを全部数え直した

モデル
Cohereは「ソブリンAI」を事業部門にした──概念でなく採用ページの職種・組織名で確認するの記事画像

Cohereは「ソブリンAI」を事業部門にした 概念でなく採用ページの職種・組織名で確認する

業界
ELYZA-Thinking-1.0-llm-jp-4-33b のキービジュアル動画

ELYZA、国産llm-jp-4を土台にした新モデル2つと「AIがAIを作る」研究組織を発表 総合点は7か月前のQwen3.5・Gemma 4に届かず

モデル実機で検証
Macの統合メモリではこの技がそもそも要らない理由──llama.cppの--cpu-moe/-ncmoeを公式ドキュメントで確認したの記事画像

Macの統合メモリではこの技がそもそも要らない理由 llama.cppの--cpu-moe/-ncmoeを公式ドキュメントで確認した

活用
Liquid AIの小型モデルLFM2.5を「速く・正確に」する2本──①DSparkの草稿モデル(約300M)で投機的デコード、出力は同一のままH100で最大3.18倍・M4 Max MacBookで最大2.87倍、関数呼び出しの遅延を57%削減 ②350MモデルをGRPOで100ステップ(無料枠のColab)微調整し、構造化出力の遵守率をIFStructで22.6%→29.7%の記事画像

Liquid AIの小型モデルLFM2.5を「速く・正確に」する2本 ①DSparkの草稿モデル(約300M)で投機的デコード、出力は同一のままH100で最大3.18倍・M4 Max MacBookで最大2.87倍、関数呼び出しの遅延を57%削減 ②350MモデルをGRPOで100ステップ(無料枠のColab)微調整し、構造化出力の遵守率をIFStructで22.6%→29.7%

検証(発表 8月20日)