腾讯发布 WeVisDoc-2B 和 WeVisDoc-4B 文档解析器
腾讯发布了 WeVisDoc,这是一种针对页面图像端到端的文档解析器,基于 Qwen3-VL 模型微调而成。该系统将页面图像转换为结构化的 Markdown,包括 LaTeX 公式和 HTML 表格。
腾讯发布了 WeVisDoc,这是一种针对页面图像端到端的文档解析器,基于 Qwen3-VL 模型微调而成。该系统将页面图像转换为结构化的 Markdown,包括 LaTeX 公式和 HTML 表格。
腾讯发布了 WeVisDoc-4B,这是一款用于页面图像的端到端文档解析器,可将页面转换为包含 LaTeX 公式和 HTML 表格的结构化 Markdown。该模型基于 Qwen3-VL-4B-Instruct 进行微调,在 OmniDocBench v1.6 上取得了 95.38 的总体得分,并在所有四项报告的设置中位居被比较的解析器之首。
Tencent 发布了 Simple Attention Sparsification (SAS) 检查点,用于在 Qwen3 模型中为每个查询学习排序和选择 KV 块。与蒸馏密集注意力分数的方法不同,SAS 向选定的块添加连续门控,从而实现使用语言建模损失的上下文排序端到端优化。
腾讯已将其用于语音生成和编辑的AuK 1.5B基础模型作为开源软件发布,包括代码和模型权重。
腾讯已将用于语音生成和编辑的 AuK 基础模型开源,包括在 Hugging Face 和 ModelScope 上的代码和权重。此次发布包含 AuK-Flash,这是一种专为快速推理设计的蒸馏变体,仅需 4 步。
腾讯发布了EVIE-4.5B,这是一款高性能的多语言视觉文档检索模型,具备动态前缀多向量检索延迟(Prefix-MRL)和无需训练的层次凝聚聚类(HAC)token压缩技术。
腾讯发布了EVIE-8B,这是一款高容量视觉文档检索模型,具有4096维的token表示和双向全注意力机制。该模型作为轻量级EVIE-4.5B Prefix-MRL变体的教师基础模型,在视觉文档检索基准测试中实现了最先进的性能。