Tencentは、Qwen3-VLモデルからファインチューニングされたページ画像用のエンドツーエンドのドキュメントパーサーであるWeVisDocをリリースしました。このシステムは、LaTeX数式やHTMLテーブルを含む構造化されたMarkdownにページ画像を変換します。
- WeVisDoc-4BはOmniDocBench v1.6で総合スコア95.38を達成し、PureDocBenchトラック全体で平均総合スコア75.54を獲得しました。
- 報告されたすべての4つの設定において、比較されたエンドツーエンドのパーサーの中で第1位となりました。
- リリースにはWeVisDoc-2BおよびWeVisDoc-4Bのモデルチェックポイントが含まれています。
モデルはローカル推論またはvLLMベースのサービス経由で利用可能で、Python 3.10+をサポートしています。