Tencent telah merilis WeVisDoc, parser dokumen end-to-end untuk gambar halaman yang di-fine-tune dari model Qwen3-VL. Sistem ini mengonversi gambar halaman menjadi Markdown terstruktur, termasuk rumus LaTeX dan tabel HTML.

  • WeVisDoc-4B mencapai skor Overall 95.38 di OmniDocBench v1.6 dan skor Overall rata-rata 75.54 di lintas trek PureDocBench.
  • Ia menempati peringkat pertama di antara parser end-to-end yang dibandingkan dalam keempat pengaturan yang dilaporkan.
  • Rilis ini mencakup checkpoint model WeVisDoc-2B dan WeVisDoc-4B.

Model tersedia untuk inferensi lokal atau melalui layanan berbasis vLLM, mendukung Python 3.10+.