TencentがWeVisDoc-2BおよびWeVisDoc-4Bドキュメントパーサーをリリース
Tencentは、Qwen3-VLモデルからファインチューニングされたページ画像用のエンドツーエンドのドキュメントパーサーであるWeVisDocをリリースしました。このシステムは、LaTeX数式やHTMLテーブルを含む構造化されたMarkdownにページ画像を変換します。
Tencentは、Qwen3-VLモデルからファインチューニングされたページ画像用のエンドツーエンドのドキュメントパーサーであるWeVisDocをリリースしました。このシステムは、LaTeX数式やHTMLテーブルを含む構造化されたMarkdownにページ画像を変換します。
Tencentは、ページ画像用のエンドツーエンドのドキュメントパーサーであるWeVisDoc-4Bをリリースしました。これは、LaTeX数式とHTMLテーブルを含む構造化されたMarkdownにページを変換します。Qwen3-VL-4B-Instructからファインチューニングされ、OmniDocBench v1.6で総合スコア95.38を達成し、報告されたすべての4つの設定において比較されたパーサーの中で1位となりました。
Tencentは、Qwen3モデルの各クエリに対してKVブロックをランク付けおよび選択する方法を学習するSimple Attention Sparsification (SAS) チェックポイントをリリースしました。密集なアテンションスコアを蒸留する手法とは異なり、SASは選択されたブロックに連続ゲートを追加し、言語モデリング損失によるコンテキストランクのエンドツーエンド最適化を可能にします。
Tencentは、音声生成および編集のための基盤モデルAuK 1.5Bを、コードおよびモデルウェイトとともにオープンソースソフトウェアとして公開しました。
Tencentは、音声生成および編集のための基盤モデルAuKをオープンソースとして公開しました。Hugging FaceおよびModelScope上でコードと重みが利用可能です。今回のリリースには、わずか4ステップで高速推論を実現するよう設計された蒸留版のAuK-Flashが含まれています。
Tencentは、動的Prefix-Multivector Retrieval Latency(Prefix-MRL)とトレーニング不要のHierarchical Agglomerative Clustering(HAC)トークン圧縮を搭載した高性能な多言語視覚文書検索モデルであるEVIE-4.5Bをリリースしました。
Tencentは、4096次元のトークン表現と双方向フルアテンションを特徴とする高容量の視覚文書検索モデルEVIE-8Bをリリースした。このモデルは、軽量なEVIE-4.5B Prefix-MRLバリアントのための教師基盤として機能し、視覚文書検索ベンチマークで最先端のパフォーマンスを実現している。