Tencent выпустила WeVisDoc, сквозной документальный парсер для изображений страниц, дообученный на моделях Qwen3-VL. Система преобразует изображения страниц в структурированный Markdown, включая формулы LaTeX и HTML-таблицы.

  • WeVisDoc-4B достигает общего балла 95.38 на OmniDocBench v1.6 и среднего общего балла 75.54 по трекам PureDocBench.
  • Он занимает первое место среди сравниваемых сквозных парсеров во всех четырех указанных настройках.
  • В релиз включены контрольные точки моделей WeVisDoc-2B и WeVisDoc-4B.

Модели доступны для локального вывода или через сервис на базе vLLM, поддерживающий Python 3.10+.