Tencent a lancé WeVisDoc, un analyseur de documents de bout en bout pour les images de pages, affiné à partir des modèles Qwen3-VL. Le système convertit les images de pages en Markdown structuré, incluant des formules LaTeX et des tableaux HTML.
- WeVisDoc-4B atteint un score global de 95.38 sur OmniDocBench v1.6 et un score moyen global de 75.54 sur les pistes PureDocBench.
- Il se classe premier parmi les analyseurs de bout en bout comparés dans les quatre configurations rapportées.
- La release inclut les checkpoints des modèles WeVisDoc-2B et WeVisDoc-4B.
Les modèles sont disponibles pour l'inférence locale ou via un service basé sur vLLM, prenant en charge Python 3.10+.