AI時短ラボ
モデル· 約22分

Tencentが文書解析AI「WeVisDoc」をオープンウェイト公開──OmniDocBench v1.6で95.38、end-to-end型パーサーの比較で首位と主張

Tencentは、Qwen3-VL-2B/4B-Instructをファインチューンしたページ画像向け文書パーサー「WeVisDoc-2B/4B」をApache-2.0ライセンスでHugging Faceに公開した(コミット履歴上の重みのアップロードは2026年9月16日・UTC)。技術レポート(arXiv:2609.20423)によると、WeVisDoc-4BはOmniDocBench v1.6でOverall 95.38、PureDocBench 3トラック平均75.54で、比較したend-to-end型パーサーの中では4つの評価設定すべてで首位だったという。日本語圏での報道は本記事の調査時点で確認できていない。

Tencentが文書解析AI「WeVisDoc」をオープンウェイト公開──OmniDocBench v1.6で95.38、end-to-end型パーサーの比較で首位と主張
執筆・編集:
目次

Tencentは、ページ画像を構造化Markdown(LaTeX数式・HTMLテーブル込み)に変換する文書パーサー「WeVisDoc」の重みをHugging Faceで公開した。Hugging Faceのコミット履歴では、重みのアップロードが2026年9月16日(UTC)、READMEへの技術レポートのリンク追加が9月18日(UTC)。Alibaba「Qwen3-VL」シリーズの2B/4B-Instructをファインチューンしたモデルで、ライセンスはApache-2.0。公式の技術レポート(arXiv:2609.20423)は、4B版がOmniDocBench v1.6でOverallスコア95.38、別の研究グループが2026年5月に発表したベンチマーク「PureDocBench」の3トラック平均で75.54を記録し、比較したend-to-end型の文書パーサーの中で4つの評価設定すべてで最高値だったと主張している。

3行まとめ

  • TencentはQwen3-VL-2B/4B-InstructをファインチューンしたWeVisDoc-2B/4BをApache-2.0ライセンスでHugging Faceに公開。コミット履歴では重みのアップロードが2026年9月16日(UTC)、技術レポート(arXiv:2609.20423、9月17日投稿)へのリンク追加が9月18日
  • 公式主張: WeVisDoc-4BはOmniDocBench v1.6でOverall 95.38(比較対象中トップ、2番手は2B版の95.06、WeVisDoc以外の最高は同じTencentのHunyuanOCR-1.5で94.74)、PureDocBench平均75.54(2番手はFD-RLの73.92)。比較対象はend-to-end型の文書解析専用モデルに限られる
  • 学習は2段階。Stage Iでデータの網羅性を広げ、Stage IIが保留プローブで残る誤りを診断し追加データの配分を決める。4B版のReal DegradedトラックはStage I比で+4.03ポイント伸びたと要旨は報告している

2モデルの基本仕様

項目 内容
公開元 Tencent(プロジェクトページの表記は「WeChat Vision Team, Tencent Inc.」)
モデル名 WeVisDoc-4B / WeVisDoc-2B
ベースモデル Qwen3-VL-4B-Instruct / Qwen3-VL-2B-Instruct(いずれもHugging FaceのQwen組織が公開)
ライセンス Apache-2.0(Hugging FaceのモデルカードとGitHubリポジトリの両方)
アーキテクチャ Qwen3VLForConditionalGeneration
パラメータ数(HF API実測) 4B版: 総計4,437,815,808(約44.4億) / 2B版: 総計2,438,696,960(約24.4億)
モデルカード言語タグ en, zh(日本語タグは無し)
技術レポート arXiv:2609.20423「WeVisDoc: From Coverage to Capability for Robust End-to-End Document Parsing」(cs.CV、2026年9月17日投稿)
著者 Hao Yu, Kang Liu, Linnan Zhao, Jiabo Zhan, Chong Sun, Chen Li, Jing Lyu
OmniDocBench v1.6 Overall 4B: 95.38 / 2B: 95.06(比較対象中の最高・次点)
PureDocBench 平均(Avg₃) 4B: 75.54(比較対象中の最高) / 2B: 73.86(FD-RLの73.92に次ぐ3位)
PureDocBenchの出自 Zhiheng Liら15人が2026年5月にarXiv:2605.07492で発表したベンチマーク。10分野・1,475ページをclean / digitally degraded / real-degradedの3版で用意(計4,425画像)。著者はWeVisDocの7人と重ならない
ダウンロード数・likes(2026年9月25日12時台・日本時間、HF API) 4B: 1,067DL・47likes / 2B: 1,141DL・22likes

何をするモデルか

Hugging Face上のREADME(一次ソース、curlで取得)は、WeVisDocを「ページ画像向けのend-to-end文書パーサー」と説明している。入力はページ画像(PNG・JPEG・WebP)で、出力は構造化されたMarkdown。数式はLaTeX、表はHTMLタグの形で埋め込まれる。PDFを処理する場合は、事前にページ画像へレンダリングしておく必要があるとREADMEに明記されている。

サイズは2B版と4B版の2種類。プロジェクトページは次のように書き分けている。

Start with the compact 2B checkpoint or use the 4B checkpoint for the strongest reported results.

(小型の2Bチェックポイントから始めるか、報告した中で最も高い結果を出した4Bチェックポイントを使ってください)

ただしREADMEの評価表では、OmniDocBench v1.6のTableTEDS(表の認識)だけは2B版の93.03が4B版の92.95をわずかに上回っている。

Tencentが載せた評価表(上位10行ずつ)

READMEに掲載された評価表を、比較対象を含めて上位10行ずつ転記する。READMEの注記は3点ある。表に載せたのはend-to-end型の文書解析専用モデルだけであること(パイプライン型のパーサーや汎用のVLMは比較に入っていない)、WeVisDocの結果は3回の推論の平均であること、*付きの比較対象はTencent自身の評価パイプラインで測った値で、無印は各手法の論文からの引用であること。

OmniDocBench v1.6(抜粋・上位10モデル)

モデル パラメータ Overall↑ FormulaCDM↑ TableTEDS↑
FD-RL* 4B 91.21 92.92 86.22
HunyuanOCR 1B 92.03 88.60 92.37
dots.mocr* 3B 92.57 92.09 89.78
FireRed-OCR 2B 93.26 95.44 88.04
Logics-Parsing-v2 4B 93.33 95.65 88.42
Qianfan-OCR 4B 93.90 95.08 90.53
Unlimited-OCR 3B-A0.5B 93.92 95.79 90.16
HunyuanOCR-1.5 1B 94.74 94.50 93.67
WeVisDoc-2B 2B 95.06 95.94 93.03
WeVisDoc-4B 4B 95.38 96.81 92.95

HunyuanOCRとHunyuanOCR-1.5も、Hugging Faceのtencent/HunyuanOCRで配布されているTencentのモデルである。

PureDocBench(抜粋・上位10モデル、Avg₃は3トラックOverallの平均)

モデル パラメータ Avg₃↑ Clean↑ Digital Degraded↑ Real Degraded↑
dots.ocr 3B 64.55 72.01 65.95 55.68
Nanonets-OCR-s* 3B 65.37 71.26 66.56 58.28
FireRed-OCR 2B 65.57 70.81 68.49 57.42
HunyuanOCR-1.5* 1B 68.79 73.98 70.81 61.59
OCRVerse 4B 69.40 73.18 71.36 63.66
dots.mocr 3B 70.39 76.27 73.16 61.73
Logics-Parsing-v2 4B 72.61 76.35 73.85 67.64
FD-RL 4B 73.92 78.38 76.33 67.04
WeVisDoc-2B 2B 73.86 79.36 76.62 65.60
WeVisDoc-4B 4B 75.54 79.81 77.74 69.08

自分でAvg₃を計算し直すと、WeVisDoc-4Bの(79.81+77.74+69.08)÷3は75.54で表の値と一致した。一方WeVisDoc-2Bの73.86は、4BのFD-RL(73.92)をわずかに下回っている。README・技術レポート要旨の「4つの評価設定すべてで首位」という主張は4B版についてのもので、4つの設定はOmniDocBench v1.6と、PureDocBenchのClean・Digital Degraded・Real Degradedの3トラックを指す(READMEの図の説明文による)。2B版はOmniDocBench v1.6では次点だが、PureDocBench平均では3位、Real Degradedトラック単独ではLogics-Parsing-v2(67.64)とFD-RL(67.04)にも届かず4位になる。README本文と要旨は2B版の順位には触れていない。

2段階の学習フレームワーク

arXivの要旨(アブストラクトのみ確認。本文・図表は未読)によると、WeVisDocは「データ中心の2段階フレームワーク」で作られている。

  • Stage I: 異種データと構造保持型の劣化合成(structure-preserving degradation synthesis)により、意味・構造・見た目のカバレッジを広げる
  • Stage II: 保留(held-out)プローブを使い、Stage Iのパーサーに残る誤りを固定された視覚・構造クラスタ単位で測定する。この診断結果をもとに、追加データの構築とターゲットトークン予算の再配分を行う

要旨は、Stage IIによってOmniDocBench・PureDocBenchの両方で2B/4Bモデルのスコアが伸び、特に劣化条件のPureDocBenchトラック(Digital Degraded・Real Degraded)での伸びが大きいとし、例として4BモデルのReal Degradedトラックで4.03ポイントの改善を挙げている。プロジェクトページは、4B版のStage IからStage IIへの伸びをOverallでOmniDocBench +1.16、PureDocBench Clean +0.49、Digital Degraded +2.55、Real Degraded +4.03と並べている。

動かし方

READMEのQuick Startによれば、Python 3.10以上が必要で、vLLM用とTransformers用に別々の仮想環境を用意することを推奨している。vLLMでサービングする場合、bash scripts/serve_vllm.sh Tencent/WeVisDoc-2B(4B版はTencent/WeVisDoc-4Bに差し替え)でAPIサーバーを立て、クライアント(python -m wevisdoc.client)から画像を渡す構成。デフォルトのMAX_MODEL_LENは32768トークンで、vLLMは0.11.1以上が必要とREADMEに明記されている。ローカルでTransformersのみを使う推論スクリプト(python -m wevisdoc.local)も用意されている。

scripts/やwevisdoc/のコードはGitHubリポジトリ(Tencent/WeVisDoc)に入っており、Hugging Faceのモデルリポジトリに置かれているのは重み・設定ファイル・READMEである(両方のファイル一覧で確認)。

コミット履歴と報道の有無を追った

Hugging FaceのModels APIのコミット履歴(huggingface.co/api/models/tencent/WeVisDoc-4B/commits/mainおよび-2B版、curlで取得)を見ると、WeVisDoc-4Bは2026年9月16日03:07(UTC)にinitial commit、同日09:53にUpload folder using huggingface_hubで重みファイル(safetensors 2分割)と設定一式が入り、2026年9月18日02:50の「Update technical report link and citation」でREADMEが更新されている。9月16日時点のREADMEを取り出すと、Technical Reportのバッジはリンク先が無く「Coming soon」となっていて、9月18日のコミットでarXivのURLに差し替わり、Citation節が加わっていた。WeVisDoc-2Bもほぼ同じ時間帯(9月16日03:06の初期コミット、08:51の重みアップロード、9月18日02:50の技術レポート追記)。重みのアップロードから技術レポートのリンク追加まで2日弱の間があったことになる。

コミット履歴から分かるのはアップロードの日時で、リポジトリが一般公開に切り替わった日時はAPIの応答からは分からない。GitHubリポジトリ(Tencent/WeVisDoc)の作成日時は、GitHub APIで2026年9月14日07:45(UTC)だった。

日本語圏の報道の有無も確認した。2026年9月25日昼(日本時間)に、Google Newsの検索フィード(news.google.com/rss/search?q=WeVisDoc)を日本語・英語の設定でそれぞれ取得すると、項目はいずれも0件だった。Bingニュースの検索フィード(bing.com/news/search?q=WeVisDoc&format=rss)は2件を返したが、中国語の動画(bilibili、9月17日付)と、GitHub上の第三者によるフォークのREADMEで、日本語の記事は無かった。フィードが拾っていないだけの可能性は残るため「報道が無い」とは断定できないが、この2つの検索の範囲では見つからなかった。

独立評価・日本語精度・実際の動作はまだ確かめていない

  • 第三者による再現評価は、本記事の確認範囲では見当たらない。 WeVisDocのスコアはいずれもTencentが自らの評価として載せたもの。OmniDocBenchの公式GitHubリポジトリ(opendatalab/OmniDocBench)のREADMEのリーダーボードは、2026年9月11日の更新(TeleOCR・OvisOCR2・Unlimited-OCRを追加)が最新で、9月25日昼の時点でWeVisDocは載っていない。
  • 技術レポートは要旨とプロジェクトページのみ確認した。 本文・図表・学習データの詳細な内訳までは読んでいない。Stage I/Stage IIの記述は要旨とプロジェクトページの範囲に限られる。
  • 日本語文書での精度は情報が無い。 モデルカードの言語タグは英語・中国語のみで、README(英語版・中国語版)、プロジェクトページ、技術レポート要旨のいずれにも、日本語の文書画像に対する精度の記載は無かった(「Japanese」「日本」「日语」「multilingual」などで検索した範囲)。
  • 実際にモデルを動かしての検証はしていない。 vLLMサーバーを立ててWeVisDocに画像を通す作業は本記事の範囲では行っていない。使い方の記述はREADMEの内容をそのまま整理したものである。
  • Hugging Face以外の公式配布経路は見つかっていない。 READMEのバッジはGitHub・プロジェクトページ・Hugging Face(4B/2B)・arXivの5つ。ModelScopeを「WeVisDoc」で検索した範囲(9月25日昼)では、Tencentの公式リポジトリは無く、第三者によるGGUF変換版(prithivMLmods/WeVisDoc-4B-GGUF・WeVisDoc-2B-GGUF)の2件だけが出た。

WeVisDocの一次資料と取得日時

続報や技術レポート本文を読んだ上での追記があれば、この記事を更新する。

関連記事

シェア: ポスト はてブ

出典・参照資料

AIニュースの解説を動画でも

YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。

コメント

まだコメントはありません。最初のコメントを書いてみませんか?

AIについて聞きたいことはありますか?

質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。

質問箱を見る →

新しい記事をメールで受け取る

AIの新しい発表を、出典付きで整理して届けます。

関連記事

Tencentが「画面を見て操作する」オープンウェイトAIエージェントを公開──OSWorld-Verifiedで77.0点、手元で動かせるcomputer useの選択肢の記事画像
モデル09.06読了10分

Tencentが「画面を見て操作する」オープンウェイトAIエージェントを公開──OSWorld-Verifiedで77.0点、手元で動かせるcomputer useの選択肢

出典 ─ Hugging Face
テンセントのHy4 previewはClaude Haikuより安い──公開ベンチ46行を数えたらKimi K3と23勝22敗だったの記事画像
モデル08.28読了16分

テンセントのHy4 previewはClaude Haikuより安い──公開ベンチ46行を数えたらKimi K3と23勝22敗だった

出典 ─ Tencent「Introducing Hy
AI OCR 文字認識ツール おすすめ比較【2026年最新】の記事画像
活用07.05読了8分

AI OCR 文字認識ツール おすすめ比較【2026年最新】

出典 ─ AI OCR比較41選|価格相場や選定ポイン
Alibaba、Qwen-Image-2.1の重みを公開──絵を描く部分は7B、自社ベンチで29モデル中7位(Nano Banana 2.0より上)、透明PNGと参照10枚の編集を1モデルで。ライセンスは研究限定の記事画像
モデル09.20読了20分

Alibaba、Qwen-Image-2.1の重みを公開──絵を描く部分は7B、自社ベンチで29モデル中7位(Nano Banana 2.0より上)、透明PNGと参照10枚の編集を1モデルで。ライセンスは研究限定

出典 ─ Qwen公式ブログ「Qwen-Image-2
Qwen3.8-27Bが公開──1枚のGPUに収まる密モデルで動画も読める、ダウンロード330万回・likes 1.3万で中国勢8月最多の記事画像
モデル09.07読了18分

Qwen3.8-27Bが公開──1枚のGPUに収まる密モデルで動画も読める、ダウンロード330万回・likes 1.3万で中国勢8月最多

出典 ─ Hugging Face
中国AIモデルまとめ【2026年9月版】──DeepSeek・Qwen・Kimi・GLM・MiniMax・Tencentの現行モデル、API価格、重みの公開状況(Hugging Faceで確認)、ライセンスの条件、データの保存先。覆面モデルOx Alpha(GLM-5.3-Flash)とUnion Alpha(UnbiasedのPareto)の正体までの記事画像
モデル09.24読了20分

中国AIモデルまとめ【2026年9月版】──DeepSeek・Qwen・Kimi・GLM・MiniMax・Tencentの現行モデル、API価格、重みの公開状況(Hugging Faceで確認)、ライセンスの条件、データの保存先。覆面モデルOx Alpha(GLM-5.3-Flash)とUnion Alpha(UnbiasedのPareto)の正体まで

出典 ─ Hugging Face Models AP
Qwen4とは──9月22日の雲栖大会で「Qwen4 Series Coming Soon」として Qwen4-Max/Flash & Plus/27B の3枠が出た。公式プレスリリースは「訓練中」「4.5・5は5〜10兆パラメータ」まで。「人間ゼロ介入で33回の自己改善」の主張と、Artificial Analysisで実測した現行Maxの位置(45・首位53)の記事画像
モデル09.22読了12分

Qwen4とは──9月22日の雲栖大会で「Qwen4 Series Coming Soon」として Qwen4-Max/Flash & Plus/27B の3枠が出た。公式プレスリリースは「訓練中」「4.5・5は5〜10兆パラメータ」まで。「人間ゼロ介入で33回の自己改善」の主張と、Artificial Analysisで実測した現行Maxの位置(45・首位53)

出典 ─ Alibaba Unveils Roadma
Qwen3.8-Maxの重みは「Apache 2.0ではない」──売上5,000万ドル超のAIサービス事業者だけに求められる別途契約を条文で読むの記事画像
モデル09.06読了10分

Qwen3.8-Maxの重みは「Apache 2.0ではない」──売上5,000万ドル超のAIサービス事業者だけに求められる別途契約を条文で読む

出典 ─ Hugging Face