Tencent, WeVisDoc-2B 및 WeVisDoc-4B 문서 파서 출시
Tencent은 Qwen3-VL 모델에서 파인튜닝된 페이지 이미지를 위한 엔드투엔드 문서 파서인 WeVisDoc을 출시했습니다. 이 시스템은 LaTeX 수식과 HTML 테이블을 포함한 구조화된 Markdown으로 페이지 이미지를 변환합니다.
Tencent은 Qwen3-VL 모델에서 파인튜닝된 페이지 이미지를 위한 엔드투엔드 문서 파서인 WeVisDoc을 출시했습니다. 이 시스템은 LaTeX 수식과 HTML 테이블을 포함한 구조화된 Markdown으로 페이지 이미지를 변환합니다.
Tencent은 페이지 이미지를 구조화된 Markdown(LaTeX 수식 및 HTML 테이블 포함)로 변환하는 엔드투엔드 문서 파서인 WeVisDoc-4B를 출시했습니다. Qwen3-VL-4B-Instruct에서 파인튜닝된 이 모델은 OmniDocBench v1.6에서 종합 점수 95.38을 달성했으며, 보고된 모든 네 가지 설정에서 비교된 파서 중 1위를 차지했습니다.
Tencent은 Qwen3 모델의 각 쿼리에 대해 KV 블록을 순위 매기고 선택하는 방법을 학습하는 Simple Attention Sparsification (SAS) 체크포인트를 출시했습니다. 밀집 어텐션 점수를 증류하는 방법과 달리 SAS는 선택된 블록에 연속 게이트를 추가하여 언어 모델링 손실로 컨텍스트 랭킹의 엔드투엔드 최적화를 가능하게 합니다.
Tencent는 코드와 모델 가중치를 포함하여 음성 생성 및 편집을 위한 AuK 1.5B 파운데이션 모델을 오픈소스 소프트웨어로 공개했습니다.
Tencent는 음성 생성 및 편집을 위한 AuK 파운데이션 모델을 Hugging Face와 ModelScope에서 코드와 가중치와 함께 오픈소스로 공개했습니다. 이번 릴리스에는 단 4단계로 빠른 추론이 가능한 압축 변형인 AuK-Flash가 포함되어 있습니다.
텐센트는 동적 Prefix-Multivector Retrieval Latency(Prefix-MRL)와 학습 불필요한 Hierarchical Agglomerative Clustering(HAC) 토큰 압축을 특징으로 하는 고성능 다국어 시각 문서 검색 모델인 EVIE-4.5B를 출시했습니다.
텐센트는 4096차원 토큰 표현과 양방향 전체 어텐션을 특징으로 하는 고용량 시각적 문서 검색 모델인 EVIE-8B를 출시했습니다. 이 모델은 경량화된 EVIE-4.5B Prefix-MRL 변형의 교사 파운데이션 역할을 하며, 시각적 문서 검색 벤치마크에서 최첨단 성능을 달성합니다.