腾讯发布了 WeVisDoc,这是一种针对页面图像端到端的文档解析器,基于 Qwen3-VL 模型微调而成。该系统将页面图像转换为结构化的 Markdown,包括 LaTeX 公式和 HTML 表格。
- WeVisDoc-4B 在 OmniDocBench v1.6 上取得了 95.38 的总体得分,在 PureDocBench 各赛道上的平均总体得分为 75.54。
- 在所有报告的四种设置中,它在所有对比的端到端解析器中排名第一。
- 此次发布包含 WeVisDoc-2B 和 WeVisDoc-4B 模型检查点。
该模型可用于本地推理或通过基于 vLLM 的服务,支持 Python 3.10+。