H Company「NeoMME」画像パッチとテキストを1つの双方向Transformerで処理する260M・800Mの多言語マルチモーダルエンコーダ(Apache 2.0)。事前学習の視覚塔も言語モデルも使わずマスク離散拡散でゼロから学習。文書検索版はViDoRe v3で260Mが0.523(ColQwen2.5の14分の1のパラメータ)、索引は1ページ1.5MB→6kB(255分の1)
H Companyは2026年9月3日、多言語マルチモーダルエンコーダ「NeoMME」(260Mと800M、Apache 2.0)を公開した。多くの視覚文書検索器は生成型VLMから流用するが、検索や分類は文を生成しないので因果デコーダの重さは要らない。NeoMMEは32×32のパッチにした画像とテキストのトークンを同じ双方向Transformerに入れ、事前学習の視覚塔もテキストのエンコーダ・デコーダも使わず、マスクした離散拡散のテキスト復元(画像付きの例はマスク率0.3〜1)でゼロから学習した。文脈16,384トークン、約5,240億トークン。ColPaliのページ画像方式で微調整したNeoMME-Retrieverは1回の順伝播で密ベクトルと遅延相互作用の両方を返し、ViDoRe v3(nDCG@10)で260Mが0.523(ColQwen2.5との差0.002で約14分の1のパラメータ)、800Mが0.556。L40Sで260Mは毎秒約51ページ。階層的トークンプーリングと非対称量子化で索引を1ページ約1.5MBから6kB(255分の1)にしつつ精度の95%超を維持。

2026年9月18日・日本時間時点の情報です。 Hugging FaceのH Companyのブログ(9月3日)を読んだ。PDFをOCRせずページ画像のまま検索する系統(ColPali)の新しい土台で、小さく速いので、社内文書のRAGを組む人向けに残す。
3行まとめ
- 設計。 多くの視覚文書検索器は生成型VLM(別に事前学習した視覚エンコーダ→射影→因果デコーダ)から流用するが、検索・分類・トークンラベリングは文を生成しないので因果デコーダの重さは要らない。NeoMMEは、32×32のパッチにした画像とテキストのトークンを1つの双方向Transformerに入れ、事前学習の視覚塔も、テキストのエンコーダ・デコーダも使わずゼロから学習した。動的解像度(縦横比と大きさを保ち、密度の高い文書ページに多くのトークンを使う)、文脈16,384トークン(4K画像2枚分)、スライディングウィンドウ注意と6層ごと+最終層の全域注意、GQA・QK正規化・ゲート付き注意・2D RoPE・二乗ReLU、多言語テキスト・コード・数学・画像の書き起こしで学習した13.1万語彙のBPE。
- 学習。 マスクした離散拡散のテキスト復元で、テキストのみの例はマスク率を0〜1で一様に、画像付きの例は0.3〜1にして、軽いマスクなら文脈だけで埋まる(「The [MASK] sat on the mat」→cat)のに対し、重いマスクで画像の証拠を使わざるを得なくする。約5,240億トークン(テキストのみ2,900億。ModernBERTの2兆に比べ小さいので、データ効率のためNorMuon最適化を採用)。
- 検索の成績。 ColPaliのページ画像方式で微調整したNeoMME-Retrieverは、1回の順伝播で密ベクトル(平均プーリング、ANN向き)と遅延相互作用(トークン・パッチごとの128次元、局所一致を保つ)の両方を返す。ViDoRe v3(nDCG@10)で260Mが0.523──800M未満で最高、ColQwen2.5との差0.002で約14分の1のパラメータ──、800Mが0.556(同規模のVultron Retriever Flashとの差0.009)で、両方が大きさ対精度のパレート前線に乗る。v1・v2(nDCG@5)でも260MはColModernVBERTと2倍大きいColSmol-500Mを上回り、800MはColPali v1.3を3.6分の1のパラメータで上回る。2048×2048入力・NVIDIA L40Sで260Mは毎秒約51ページ(ColModernVBERTの約2倍)。階層的トークンプーリングと非対称量子化で遅延相互作用の索引を1ページ約1.5MB→6kB(255分の1)にしつつ、nDCG@10の95%超を維持。大規模コーパスなら密ベクトルでANN検索→遅延相互作用で再ランク、を勧める。
索引6kBの効果と日本語未検証
- 「PDFをOCRせずページ画像で検索する」方式は、表・図・フォントの手がかりを残せる反面、索引が重いのが難点だった。1ページ6kBはその難点への答えで、社内文書数十万ページでも索引が現実的になる
- 多言語対応をうたうが、日本語の文書ページでの評価は本文にない(ViDoReの言語構成次第)。筆者は未検証
- 「拡散でエンコーダを学習する」は、Diffusion GemmaやRetrieve-for-Trainと同じ月に出た、拡散の用途拡大の一例
- H Companyはフランスの企業で、モデルはApache 2.0でHugging FaceのTransformersから使える。デモ(Visual RAG)もある
H社ブログの数字を原文で照合
この記事の下調べで、筆者は9月18日にHugging FaceのH Companyのブログを取得し、2サイズ・Apache 2.0・構造の要素・マスク率の範囲・5,240億/2,900億トークン・ViDoReの各数字(0.523・0.556・0.002・0.009・14分の1・3.6分の1)・51ページ/秒・1.5MB→6kB・95%超がその原文にあることを確認した。技術報告とデモは開いていない。筆者は動かしていない。
評価・計算量・利用条件の記載なし
- 日本語文書での評価
- 学習に使った計算量
- 商用利用時の注意(Apache 2.0以外の条件はない)
出典はHugging FaceのH Companyのブログ
- NeoMME: an efficient Multimodal-native and Multilingual Encoder(H Company・2026年9月3日)
関連記事
出典・参照資料
大きいニュースはYouTubeでも解説しています。Xでは新着記事をお知らせしています。
コメント
まだコメントはありません。最初のコメントを書いてみませんか?
AIについて聞きたいことはありますか?
質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。
質問箱を見る →