PP-OCRv6 是一款新的光学字符识别模型,现已在 Hugging Face 上提供。它支持 50 种语言,参数量从 150 万扩展到 3450 万,在多种语言中提供了更高的准确性和效率。
lab
Hugging Face Blog
·
55 天前
·
releases
PP-OCRv6 已在 Hugging Face 发布,支持 50 种语言
译自 English → 中文
相关文章
media
r/LocalLLaMA
·
5 天前
·
6 次浏览
Google发布DiffusionGemma技术报告
Google已在arXiv上发布了DiffusionGemma的技术报告。该文档详细介绍了作为Gemma系列一部分的模型架构和能力。
media
r/LocalLLaMA
·
24 天前
·
9 次浏览
微软发布Mage-Flow,一款用于图像生成与编辑的4B原生分辨率模型
微软发布了Mage-Flow,这是一个紧凑的4B规模生成堆栈,旨在实现高效的文本到图像生成和基于指令的图像编辑。该系统通过轻量级分词器Mage-VAE与原生分辨率多模态扩散Transformer(NR-MMDiT)的协同设计,实现了具有竞争力的顶尖质量。
media
r/LocalLLaMA
·
43 天前
SenseNova 发布用于信息图设计的开源 SenseNova-U1-8b-MoT 模型
SenseNova 发布了 SenseNova-U1-8b-MoT 系列,这是一组专为生成和编辑密集信息图而设计的 Mixture of Transformers 模型。最新版本 Infographic V2 作为 50 步基础模型,采用 Apache 2 许可证。
media
r/LocalLLaMA
·
18 小时前
·
2 次浏览
阿里巴巴AI模型在Hugging Face上下载量突破30亿,超越Meta和Google
根据Hugging Face发布的《State of Open Models: Summer 2026 Observations》报告,阿里巴巴的AI模型在平台上累计下载量已达30亿次。这一里程碑标志着开源格局的重大转变,因为阿里巴巴在模型总下载量上已超越Meta和Google。
media
Interconnects
·
1 天前
·
2 次浏览
Z.ai发布GLM-5.3,扩展了后训练过程
Z.ai宣布推出GLM-5.3,这是一款通过在基础模型GLM-5.2上扩展后训练阶段,在智能体编程基准测试中取得前沿性能的新模型。该~750B参数模型目前在各种基准测试中超越了Kimi K3,并持平或超越了Claude Fable 5和GPT-5.6-Sol。