Tencentが文書解析AI「WeVisDoc」をオープンウェイト公開──OmniDocBench v1.6で95.38、end-to-end型パーサーの比較で首位と主張
Tencentは、Qwen3-VL-2B/4B-Instructをファインチューンしたページ画像向け文書パーサー「WeVisDoc-2B/4B」をApache-2.0ライセンスでHugging Faceに公開した(コミット履歴上の重みのアップロードは2026年9月16日・UTC)。技術レポート(arXiv:2609.20423)によると、WeVisDoc-4BはOmniDocBench v1.6でOverall 95.38、PureDocBench 3トラック平均75.54で、比較したend-to-end型パーサーの中では4つの評価設定すべてで首位だったという。日本語圏での報道は本記事の調査時点で確認できていない。

目次
Tencentは、ページ画像を構造化Markdown(LaTeX数式・HTMLテーブル込み)に変換する文書パーサー「WeVisDoc」の重みをHugging Faceで公開した。Hugging Faceのコミット履歴では、重みのアップロードが2026年9月16日(UTC)、READMEへの技術レポートのリンク追加が9月18日(UTC)。Alibaba「Qwen3-VL」シリーズの2B/4B-Instructをファインチューンしたモデルで、ライセンスはApache-2.0。公式の技術レポート(arXiv:2609.20423)は、4B版がOmniDocBench v1.6でOverallスコア95.38、別の研究グループが2026年5月に発表したベンチマーク「PureDocBench」の3トラック平均で75.54を記録し、比較したend-to-end型の文書パーサーの中で4つの評価設定すべてで最高値だったと主張している。
3行まとめ
- TencentはQwen3-VL-2B/4B-InstructをファインチューンしたWeVisDoc-2B/4BをApache-2.0ライセンスでHugging Faceに公開。コミット履歴では重みのアップロードが2026年9月16日(UTC)、技術レポート(arXiv:2609.20423、9月17日投稿)へのリンク追加が9月18日
- 公式主張: WeVisDoc-4BはOmniDocBench v1.6でOverall 95.38(比較対象中トップ、2番手は2B版の95.06、WeVisDoc以外の最高は同じTencentのHunyuanOCR-1.5で94.74)、PureDocBench平均75.54(2番手はFD-RLの73.92)。比較対象はend-to-end型の文書解析専用モデルに限られる
- 学習は2段階。Stage Iでデータの網羅性を広げ、Stage IIが保留プローブで残る誤りを診断し追加データの配分を決める。4B版のReal DegradedトラックはStage I比で+4.03ポイント伸びたと要旨は報告している
2モデルの基本仕様
| 項目 | 内容 |
|---|---|
| 公開元 | Tencent(プロジェクトページの表記は「WeChat Vision Team, Tencent Inc.」) |
| モデル名 | WeVisDoc-4B / WeVisDoc-2B |
| ベースモデル | Qwen3-VL-4B-Instruct / Qwen3-VL-2B-Instruct(いずれもHugging FaceのQwen組織が公開) |
| ライセンス | Apache-2.0(Hugging FaceのモデルカードとGitHubリポジトリの両方) |
| アーキテクチャ | Qwen3VLForConditionalGeneration |
| パラメータ数(HF API実測) | 4B版: 総計4,437,815,808(約44.4億) / 2B版: 総計2,438,696,960(約24.4億) |
| モデルカード言語タグ | en, zh(日本語タグは無し) |
| 技術レポート | arXiv:2609.20423「WeVisDoc: From Coverage to Capability for Robust End-to-End Document Parsing」(cs.CV、2026年9月17日投稿) |
| 著者 | Hao Yu, Kang Liu, Linnan Zhao, Jiabo Zhan, Chong Sun, Chen Li, Jing Lyu |
| OmniDocBench v1.6 Overall | 4B: 95.38 / 2B: 95.06(比較対象中の最高・次点) |
| PureDocBench 平均(Avg₃) | 4B: 75.54(比較対象中の最高) / 2B: 73.86(FD-RLの73.92に次ぐ3位) |
| PureDocBenchの出自 | Zhiheng Liら15人が2026年5月にarXiv:2605.07492で発表したベンチマーク。10分野・1,475ページをclean / digitally degraded / real-degradedの3版で用意(計4,425画像)。著者はWeVisDocの7人と重ならない |
| ダウンロード数・likes(2026年9月25日12時台・日本時間、HF API) | 4B: 1,067DL・47likes / 2B: 1,141DL・22likes |
何をするモデルか
Hugging Face上のREADME(一次ソース、curlで取得)は、WeVisDocを「ページ画像向けのend-to-end文書パーサー」と説明している。入力はページ画像(PNG・JPEG・WebP)で、出力は構造化されたMarkdown。数式はLaTeX、表はHTMLタグの形で埋め込まれる。PDFを処理する場合は、事前にページ画像へレンダリングしておく必要があるとREADMEに明記されている。
サイズは2B版と4B版の2種類。プロジェクトページは次のように書き分けている。
Start with the compact 2B checkpoint or use the 4B checkpoint for the strongest reported results.
(小型の2Bチェックポイントから始めるか、報告した中で最も高い結果を出した4Bチェックポイントを使ってください)
ただしREADMEの評価表では、OmniDocBench v1.6のTableTEDS(表の認識)だけは2B版の93.03が4B版の92.95をわずかに上回っている。
Tencentが載せた評価表(上位10行ずつ)
READMEに掲載された評価表を、比較対象を含めて上位10行ずつ転記する。READMEの注記は3点ある。表に載せたのはend-to-end型の文書解析専用モデルだけであること(パイプライン型のパーサーや汎用のVLMは比較に入っていない)、WeVisDocの結果は3回の推論の平均であること、*付きの比較対象はTencent自身の評価パイプラインで測った値で、無印は各手法の論文からの引用であること。
OmniDocBench v1.6(抜粋・上位10モデル)
| モデル | パラメータ | Overall↑ | FormulaCDM↑ | TableTEDS↑ |
|---|---|---|---|---|
| FD-RL* | 4B | 91.21 | 92.92 | 86.22 |
| HunyuanOCR | 1B | 92.03 | 88.60 | 92.37 |
| dots.mocr* | 3B | 92.57 | 92.09 | 89.78 |
| FireRed-OCR | 2B | 93.26 | 95.44 | 88.04 |
| Logics-Parsing-v2 | 4B | 93.33 | 95.65 | 88.42 |
| Qianfan-OCR | 4B | 93.90 | 95.08 | 90.53 |
| Unlimited-OCR | 3B-A0.5B | 93.92 | 95.79 | 90.16 |
| HunyuanOCR-1.5 | 1B | 94.74 | 94.50 | 93.67 |
| WeVisDoc-2B | 2B | 95.06 | 95.94 | 93.03 |
| WeVisDoc-4B | 4B | 95.38 | 96.81 | 92.95 |
HunyuanOCRとHunyuanOCR-1.5も、Hugging Faceのtencent/HunyuanOCRで配布されているTencentのモデルである。
PureDocBench(抜粋・上位10モデル、Avg₃は3トラックOverallの平均)
| モデル | パラメータ | Avg₃↑ | Clean↑ | Digital Degraded↑ | Real Degraded↑ |
|---|---|---|---|---|---|
| dots.ocr | 3B | 64.55 | 72.01 | 65.95 | 55.68 |
| Nanonets-OCR-s* | 3B | 65.37 | 71.26 | 66.56 | 58.28 |
| FireRed-OCR | 2B | 65.57 | 70.81 | 68.49 | 57.42 |
| HunyuanOCR-1.5* | 1B | 68.79 | 73.98 | 70.81 | 61.59 |
| OCRVerse | 4B | 69.40 | 73.18 | 71.36 | 63.66 |
| dots.mocr | 3B | 70.39 | 76.27 | 73.16 | 61.73 |
| Logics-Parsing-v2 | 4B | 72.61 | 76.35 | 73.85 | 67.64 |
| FD-RL | 4B | 73.92 | 78.38 | 76.33 | 67.04 |
| WeVisDoc-2B | 2B | 73.86 | 79.36 | 76.62 | 65.60 |
| WeVisDoc-4B | 4B | 75.54 | 79.81 | 77.74 | 69.08 |
自分でAvg₃を計算し直すと、WeVisDoc-4Bの(79.81+77.74+69.08)÷3は75.54で表の値と一致した。一方WeVisDoc-2Bの73.86は、4BのFD-RL(73.92)をわずかに下回っている。README・技術レポート要旨の「4つの評価設定すべてで首位」という主張は4B版についてのもので、4つの設定はOmniDocBench v1.6と、PureDocBenchのClean・Digital Degraded・Real Degradedの3トラックを指す(READMEの図の説明文による)。2B版はOmniDocBench v1.6では次点だが、PureDocBench平均では3位、Real Degradedトラック単独ではLogics-Parsing-v2(67.64)とFD-RL(67.04)にも届かず4位になる。README本文と要旨は2B版の順位には触れていない。
2段階の学習フレームワーク
arXivの要旨(アブストラクトのみ確認。本文・図表は未読)によると、WeVisDocは「データ中心の2段階フレームワーク」で作られている。
- Stage I: 異種データと構造保持型の劣化合成(structure-preserving degradation synthesis)により、意味・構造・見た目のカバレッジを広げる
- Stage II: 保留(held-out)プローブを使い、Stage Iのパーサーに残る誤りを固定された視覚・構造クラスタ単位で測定する。この診断結果をもとに、追加データの構築とターゲットトークン予算の再配分を行う
要旨は、Stage IIによってOmniDocBench・PureDocBenchの両方で2B/4Bモデルのスコアが伸び、特に劣化条件のPureDocBenchトラック(Digital Degraded・Real Degraded)での伸びが大きいとし、例として4BモデルのReal Degradedトラックで4.03ポイントの改善を挙げている。プロジェクトページは、4B版のStage IからStage IIへの伸びをOverallでOmniDocBench +1.16、PureDocBench Clean +0.49、Digital Degraded +2.55、Real Degraded +4.03と並べている。
動かし方
READMEのQuick Startによれば、Python 3.10以上が必要で、vLLM用とTransformers用に別々の仮想環境を用意することを推奨している。vLLMでサービングする場合、bash scripts/serve_vllm.sh Tencent/WeVisDoc-2B(4B版はTencent/WeVisDoc-4Bに差し替え)でAPIサーバーを立て、クライアント(python -m wevisdoc.client)から画像を渡す構成。デフォルトのMAX_MODEL_LENは32768トークンで、vLLMは0.11.1以上が必要とREADMEに明記されている。ローカルでTransformersのみを使う推論スクリプト(python -m wevisdoc.local)も用意されている。
scripts/やwevisdoc/のコードはGitHubリポジトリ(Tencent/WeVisDoc)に入っており、Hugging Faceのモデルリポジトリに置かれているのは重み・設定ファイル・READMEである(両方のファイル一覧で確認)。
コミット履歴と報道の有無を追った
Hugging FaceのModels APIのコミット履歴(huggingface.co/api/models/tencent/WeVisDoc-4B/commits/mainおよび-2B版、curlで取得)を見ると、WeVisDoc-4Bは2026年9月16日03:07(UTC)にinitial commit、同日09:53にUpload folder using huggingface_hubで重みファイル(safetensors 2分割)と設定一式が入り、2026年9月18日02:50の「Update technical report link and citation」でREADMEが更新されている。9月16日時点のREADMEを取り出すと、Technical Reportのバッジはリンク先が無く「Coming soon」となっていて、9月18日のコミットでarXivのURLに差し替わり、Citation節が加わっていた。WeVisDoc-2Bもほぼ同じ時間帯(9月16日03:06の初期コミット、08:51の重みアップロード、9月18日02:50の技術レポート追記)。重みのアップロードから技術レポートのリンク追加まで2日弱の間があったことになる。
コミット履歴から分かるのはアップロードの日時で、リポジトリが一般公開に切り替わった日時はAPIの応答からは分からない。GitHubリポジトリ(Tencent/WeVisDoc)の作成日時は、GitHub APIで2026年9月14日07:45(UTC)だった。
日本語圏の報道の有無も確認した。2026年9月25日昼(日本時間)に、Google Newsの検索フィード(news.google.com/rss/search?q=WeVisDoc)を日本語・英語の設定でそれぞれ取得すると、項目はいずれも0件だった。Bingニュースの検索フィード(bing.com/news/search?q=WeVisDoc&format=rss)は2件を返したが、中国語の動画(bilibili、9月17日付)と、GitHub上の第三者によるフォークのREADMEで、日本語の記事は無かった。フィードが拾っていないだけの可能性は残るため「報道が無い」とは断定できないが、この2つの検索の範囲では見つからなかった。
独立評価・日本語精度・実際の動作はまだ確かめていない
- 第三者による再現評価は、本記事の確認範囲では見当たらない。 WeVisDocのスコアはいずれもTencentが自らの評価として載せたもの。OmniDocBenchの公式GitHubリポジトリ(opendatalab/OmniDocBench)のREADMEのリーダーボードは、2026年9月11日の更新(TeleOCR・OvisOCR2・Unlimited-OCRを追加)が最新で、9月25日昼の時点でWeVisDocは載っていない。
- 技術レポートは要旨とプロジェクトページのみ確認した。 本文・図表・学習データの詳細な内訳までは読んでいない。Stage I/Stage IIの記述は要旨とプロジェクトページの範囲に限られる。
- 日本語文書での精度は情報が無い。 モデルカードの言語タグは英語・中国語のみで、README(英語版・中国語版)、プロジェクトページ、技術レポート要旨のいずれにも、日本語の文書画像に対する精度の記載は無かった(「Japanese」「日本」「日语」「multilingual」などで検索した範囲)。
- 実際にモデルを動かしての検証はしていない。 vLLMサーバーを立ててWeVisDocに画像を通す作業は本記事の範囲では行っていない。使い方の記述はREADMEの内容をそのまま整理したものである。
- Hugging Face以外の公式配布経路は見つかっていない。 READMEのバッジはGitHub・プロジェクトページ・Hugging Face(4B/2B)・arXivの5つ。ModelScopeを「WeVisDoc」で検索した範囲(9月25日昼)では、Tencentの公式リポジトリは無く、第三者によるGGUF変換版(prithivMLmods/WeVisDoc-4B-GGUF・WeVisDoc-2B-GGUF)の2件だけが出た。
WeVisDocの一次資料と取得日時
- tencent/WeVisDoc-4B README — Hugging Face https://huggingface.co/tencent/WeVisDoc-4B/raw/main/README.md
- tencent/WeVisDoc-2B README — Hugging Face https://huggingface.co/tencent/WeVisDoc-2B/raw/main/README.md
- Tencent/WeVisDoc — GitHub https://github.com/Tencent/WeVisDoc
- WeVisDoc プロジェクトページ — WeChat Vision Team, Tencent https://tencent.github.io/WeVisDoc
- WeVisDoc: From Coverage to Capability for Robust End-to-End Document Parsing — arXiv:2609.20423 https://arxiv.org/abs/2609.20423
- tencent/WeVisDoc-4B — Hugging Face Models API https://huggingface.co/api/models/tencent/WeVisDoc-4B (2026年9月25日12時台・日本時間取得)
- tencent/WeVisDoc-2B — Hugging Face Models API https://huggingface.co/api/models/tencent/WeVisDoc-2B (同上)
- tencent/WeVisDoc-4B コミット履歴 — Hugging Face API https://huggingface.co/api/models/tencent/WeVisDoc-4B/commits/main (同上)
- tencent/WeVisDoc-2B コミット履歴 — Hugging Face API https://huggingface.co/api/models/tencent/WeVisDoc-2B/commits/main (同上)
- How Far Is Document Parsing from Solved? PureDocBench — arXiv:2605.07492 https://arxiv.org/abs/2605.07492
- tencent/HunyuanOCR(HunyuanOCR-1.5)— Hugging Face https://huggingface.co/tencent/HunyuanOCR
- opendatalab/OmniDocBench — GitHub https://github.com/opendatalab/OmniDocBench (同上)
続報や技術レポート本文を読んだ上での追記があれば、この記事を更新する。
関連記事
出典・参照資料
- 一次資料tencent/WeVisDoc-4B README — Hugging Face ↗
- 一次資料tencent/WeVisDoc-2B README — Hugging Face ↗
- 一次資料Tencent/WeVisDoc — GitHub ↗
- 一次資料WeVisDoc プロジェクトページ — WeChat Vision Team, Tencent ↗
- 一次資料WeVisDoc: From Coverage to Capability for Robust End-to-End Document Parsing — arXiv:2609.20423 ↗
- 一次資料tencent/WeVisDoc-4B — Hugging Face Models API ↗
- 一次資料tencent/WeVisDoc-2B — Hugging Face Models API ↗
- 一次資料tencent/WeVisDoc-4B コミット履歴 — Hugging Face API ↗
- 一次資料tencent/WeVisDoc-2B コミット履歴 — Hugging Face API ↗
- 一次資料How Far Is Document Parsing from Solved? PureDocBench — arXiv:2605.07492 ↗
- 一次資料tencent/HunyuanOCR(HunyuanOCR-1.5)— Hugging Face ↗
- 一次資料opendatalab/OmniDocBench — GitHub ↗
AIニュースの解説を動画でも
YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。
コメント
まだコメントはありません。最初のコメントを書いてみませんか?
AIについて聞きたいことはありますか?
質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。
質問箱を見る →新しい記事をメールで受け取る
AIの新しい発表を、出典付きで整理して届けます。