AI時短ラボ
検索
検証

H Company「NeoMME」画像パッチとテキストを1つの双方向Transformerで処理する260M・800Mの多言語マルチモーダルエンコーダ(Apache 2.0)。事前学習の視覚塔も言語モデルも使わずマスク離散拡散でゼロから学習。文書検索版はViDoRe v3で260Mが0.523(ColQwen2.5の14分の1のパラメータ)、索引は1ページ1.5MB→6kB(255分の1)

執筆:約7分で読めます

H Companyは2026年9月3日、多言語マルチモーダルエンコーダ「NeoMME」(260Mと800M、Apache 2.0)を公開した。多くの視覚文書検索器は生成型VLMから流用するが、検索や分類は文を生成しないので因果デコーダの重さは要らない。NeoMMEは32×32のパッチにした画像とテキストのトークンを同じ双方向Transformerに入れ、事前学習の視覚塔もテキストのエンコーダ・デコーダも使わず、マスクした離散拡散のテキスト復元(画像付きの例はマスク率0.3〜1)でゼロから学習した。文脈16,384トークン、約5,240億トークン。ColPaliのページ画像方式で微調整したNeoMME-Retrieverは1回の順伝播で密ベクトルと遅延相互作用の両方を返し、ViDoRe v3(nDCG@10)で260Mが0.523(ColQwen2.5との差0.002で約14分の1のパラメータ)、800Mが0.556。L40Sで260Mは毎秒約51ページ。階層的トークンプーリングと非対称量子化で索引を1ページ約1.5MBから6kB(255分の1)にしつつ精度の95%超を維持。

H Company「NeoMME」──画像パッチとテキストを1つの双方向Transformerで処理する260M・800Mの多言語マルチモーダルエンコーダ(Apache 2.0)。事前学習の視覚塔も言語モデルも使わずマスク離散拡散でゼロから学習。文書検索版はViDoRe v3で260Mが0.523(ColQwen2.5の14分の1のパラメータ)、索引は1ページ1.5MB→6kB(255分の1)
目次

2026年9月18日・日本時間時点の情報です。 Hugging FaceのH Companyのブログ(9月3日)を読んだ。PDFをOCRせずページ画像のまま検索する系統(ColPali)の新しい土台で、小さく速いので、社内文書のRAGを組む人向けに残す。

3行まとめ

  1. 設計。 多くの視覚文書検索器は生成型VLM(別に事前学習した視覚エンコーダ→射影→因果デコーダ)から流用するが、検索・分類・トークンラベリングは文を生成しないので因果デコーダの重さは要らない。NeoMMEは、32×32のパッチにした画像とテキストのトークンを1つの双方向Transformerに入れ、事前学習の視覚塔も、テキストのエンコーダ・デコーダも使わずゼロから学習した。動的解像度(縦横比と大きさを保ち、密度の高い文書ページに多くのトークンを使う)、文脈16,384トークン(4K画像2枚分)、スライディングウィンドウ注意と6層ごと+最終層の全域注意、GQA・QK正規化・ゲート付き注意・2D RoPE・二乗ReLU、多言語テキスト・コード・数学・画像の書き起こしで学習した13.1万語彙のBPE。
  2. 学習。 マスクした離散拡散のテキスト復元で、テキストのみの例はマスク率を0〜1で一様に、画像付きの例は0.3〜1にして、軽いマスクなら文脈だけで埋まる(「The [MASK] sat on the mat」→cat)のに対し、重いマスクで画像の証拠を使わざるを得なくする。約5,240億トークン(テキストのみ2,900億。ModernBERTの2兆に比べ小さいので、データ効率のためNorMuon最適化を採用)。
  3. 検索の成績。 ColPaliのページ画像方式で微調整したNeoMME-Retrieverは、1回の順伝播で密ベクトル(平均プーリング、ANN向き)と遅延相互作用(トークン・パッチごとの128次元、局所一致を保つ)の両方を返す。ViDoRe v3(nDCG@10)で260Mが0.523──800M未満で最高、ColQwen2.5との差0.002で約14分の1のパラメータ──、800Mが0.556(同規模のVultron Retriever Flashとの差0.009)で、両方が大きさ対精度のパレート前線に乗る。v1・v2(nDCG@5)でも260MはColModernVBERTと2倍大きいColSmol-500Mを上回り、800MはColPali v1.3を3.6分の1のパラメータで上回る。2048×2048入力・NVIDIA L40Sで260Mは毎秒約51ページ(ColModernVBERTの約2倍)。階層的トークンプーリングと非対称量子化で遅延相互作用の索引を1ページ約1.5MB→6kB(255分の1)にしつつ、nDCG@10の95%超を維持。大規模コーパスなら密ベクトルでANN検索→遅延相互作用で再ランク、を勧める。

索引6kBの効果と日本語未検証

  • 「PDFをOCRせずページ画像で検索する」方式は、表・図・フォントの手がかりを残せる反面、索引が重いのが難点だった。1ページ6kBはその難点への答えで、社内文書数十万ページでも索引が現実的になる
  • 多言語対応をうたうが、日本語の文書ページでの評価は本文にない(ViDoReの言語構成次第)。筆者は未検証
  • 「拡散でエンコーダを学習する」は、Diffusion GemmaやRetrieve-for-Trainと同じ月に出た、拡散の用途拡大の一例
  • H Companyはフランスの企業で、モデルはApache 2.0でHugging FaceのTransformersから使える。デモ(Visual RAG)もある

H社ブログの数字を原文で照合

この記事の下調べで、筆者は9月18日にHugging FaceのH Companyのブログを取得し、2サイズ・Apache 2.0・構造の要素・マスク率の範囲・5,240億/2,900億トークン・ViDoReの各数字(0.523・0.556・0.002・0.009・14分の1・3.6分の1)・51ページ/秒・1.5MB→6kB・95%超がその原文にあることを確認した。技術報告とデモは開いていない。筆者は動かしていない。

評価・計算量・利用条件の記載なし

  • 日本語文書での評価
  • 学習に使った計算量
  • 商用利用時の注意(Apache 2.0以外の条件はない)

出典はHugging FaceのH Companyのブログ

関連記事

シェア: ポスト はてブ

出典・参照資料

AI時短ラボ

大きいニュースはYouTubeでも解説しています。Xでは新着記事をお知らせしています。

コメント

まだコメントはありません。最初のコメントを書いてみませんか?

AIについて聞きたいことはありますか?

質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。

質問箱を見る →

関連記事

Google Research「Retrieve-for-Train」──AI検索の「クエリ分解」を推論時に考えさせない。強化学習で一度だけ良い分解を見つけ、5,390万パラメータの拡散モデルに焼き込んで一発生成。自己回帰の12〜20倍速く、大きなバッチで50秒近くかかる処理が数秒にの記事画像

Google Research「Retrieve-for-Train」 AI検索の「クエリ分解」を推論時に考えさせない。強化学習で一度だけ良い分解を見つけ、5,390万パラメータの拡散モデルに焼き込んで一発生成。自己回帰の12〜20倍速く、大きなバッチで50秒近くかかる処理が数秒に

検証(発表 9月15日)
Google、ローカル動作の拡散型テキスト生成モデル「Diffusion Gemma」を公開の記事画像

Google、ローカル動作の拡散型テキスト生成モデル「Diffusion Gemma」を公開

モデル
Hugging Face「オープンモデルの現状・2026年夏」──中国ラボの月間最大モデル(754B〜2.78T)がほぼ毎月米国を上回る、米国で最多公開はAMDとNVIDIA、ダウンロード上位25と「いいね」上位25の重なりは1本だけ、Qwenの派生は151,448本で1日180〜210本、Hubを叩くエージェントはClaude Codeが7月44.4%・Codexが20.8%の記事画像

Hugging Face「オープンモデルの現状・2026年夏」 中国ラボの月間最大モデル(754B〜2.78T)がほぼ毎月米国を上回る、米国で最多公開はAMDとNVIDIA、ダウンロード上位25と「いいね」上位25の重なりは1本だけ、Qwenの派生は151,448本で1日180〜210本、Hubを叩くエージェントはClaude Codeが7月44.4%・Codexが20.8%

検証(発表 8月14日)
ローカルLLMとは何か──自分のPCでAIを動かす仕組み・利点・始め方を解説の記事画像動画

ローカルLLMとは何か 自分のPCでAIを動かす仕組み・利点・始め方を解説

活用
Hugging Face、ICML 2026の論文をコーディングエージェントで再現するハッカソン──19日間で1,221人が6,816本の記録を公開し2,226本(会議の34%)を試み、35,908の主張を判定。51%で少なくとも1つの主張が検証、23%で少なくとも1つが反証または係争、242本は独立チームが正反対の判定。スポットライト論文の定理が崩れ、著者は当日確認の記事画像

Hugging Face、ICML 2026の論文をコーディングエージェントで再現するハッカソン 19日間で1,221人が6,816本の記録を公開し2,226本(会議の34%)を試み、35,908の主張を判定。51%で少なくとも1つの主張が検証、23%で少なくとも1つが反証または係争、242本は独立チームが正反対の判定。スポットライト論文の定理が崩れ、著者は当日確認

検証(発表 8月13日)
Tencentが文書解析AI「WeVisDoc」をオープンウェイト公開──OmniDocBench v1.6で95.38、end-to-end型パーサーの比較で首位と主張の記事画像

Tencentが文書解析AI「WeVisDoc」をオープンウェイト公開 OmniDocBench v1.6で95.38、end-to-end型パーサーの比較で首位と主張

モデル
「MOSS-VL」とは何か──「見ながら喋る」を前提に設計し直したオープンな視覚言語モデルの記事画像

「MOSS-VL」とは何か 「見ながら喋る」を前提に設計し直したオープンな視覚言語モデル

研究
派手な発表の裏で静かに公開された中国勢3モデル──文書検索・マルチモーダル埋め込み・動画編集パイプライン【2026年8月】の記事画像

派手な発表の裏で静かに公開された中国勢3モデル 文書検索・マルチモーダル埋め込み・動画編集パイプライン【2026年8月】

モデル