Tencent выпустила WeVisDoc, сквозной документальный парсер для изображений страниц, дообученный на моделях Qwen3-VL. Система преобразует изображения страниц в структурированный Markdown, включая формулы LaTeX и HTML-таблицы.
- WeVisDoc-4B достигает общего балла 95.38 на OmniDocBench v1.6 и среднего общего балла 75.54 по трекам PureDocBench.
- Он занимает первое место среди сравниваемых сквозных парсеров во всех четырех указанных настройках.
- В релиз включены контрольные точки моделей WeVisDoc-2B и WeVisDoc-4B.
Модели доступны для локального вывода или через сервис на базе vLLM, поддерживающий Python 3.10+.