새로운 광학 문자 인식 모델인 PP-OCRv6이 이제 Hugging Face에서 사용할 수 있습니다. 이 모델은 50개 언어를 지원하며 매개변수 수가 150만에서 3450만으로 확장되어 다양한 언어에서 향상된 정확성과 효율성을 제공합니다.
Hugging Face에 PP-OCRv6 출시, 50개 언어 지원
Google, DiffusionGemma 기술 보고서 발표
Google이 arXiv에서 사용할 수 있는 DiffusionGemma에 대한 기술 보고서를 게시했습니다. 이 문서는 Gemma 계열의 일부로서 모델의 아키텍처와 기능을 자세히 설명합니다.
Microsoft, 이미지 생성 및 편집을 위한 4B 네이티브 해상도 모델 Mage-Flow 출시
Microsoft는 효율적인 텍스트-이미지 생성과 지시 기반 이미지 편집을 위해 설계된 경량 4B 규모 생성 스택인 Mage-Flow를 출시했습니다. 이 시스템은 경량 토크나이저인 Mage-VAE와 네이티브 해상도 멀티모달 디퓨전 트랜스포머(NR-MMDiT)의 공동 설계를 통해 최첨단 경쟁 수준의 품질을 달성합니다.
SenseNova, 인포그래픽 디자인을 위한 오픈 소스 SenseNova-U1-8b-MoT 모델 출시
SenseNova는 밀도 높은 인포그래픽 생성 및 편집을 위해 설계된 Mixture of Transformers 모델 세트인 SenseNova-U1-8b-MoT 시리즈를 출시했습니다. 최신 릴리스인 Infographic V2는 Apache 2 라이선스 하에 제공되는 50단계 베이스 모델입니다.
Alibaba AI 모델, Hugging Face에서 30억 다운로드 달성하며 Meta와 Google을 제치다
Hugging Face의 "State of Open Models: Summer 2026 Observations" 보고서에 따르면 Alibaba의 AI 모델은 플랫폼에서 누적 30억 번의 다운로드를 기록했습니다. 이 이정표는 오픈 소스 환경에서 중요한 전환점을 알리며, Alibaba가 이제 총 모델 다운로드 수에서 Meta와 Google을 모두 앞지르게 되었음을 의미합니다.
Z.ai, 확장된 사후 학습이 적용된 GLM-5.3 출시
Z.ai는 베이스 모델인 GLM-5.2의 사후 학습을 확장하여 에이전트 코딩 벤치마크에서 최첨단 성능을 달성한 새로운 모델 GLM-5.3을 발표했습니다. 약 750B 파라미터를 가진 이 모델은 현재 Kimi K3을 능가하며 다양한 벤치마크에서 Claude Fable 5 및 GPT-5.6-Sol과 동등하거나 이를 초과하는 성능을 보입니다.