新しい光学文字認識モデルであるPP-OCRv6が、Hugging Faceで利用可能になりました。50言語をサポートし、パラメータ数は150万から3450万まで拡張され、多様な言語において精度と効率の向上を提供します。
PP-OCRv6がHugging Faceでリリース、50言語をサポート
GoogleがDiffusionGemmaの技術レポートを公開
GoogleはarXivで入手可能なDiffusionGemmaの技術レポートを公開しました。この文書では、Gemmaファミリーの一部としてモデルのアーキテクチャと機能について詳細に説明されています。
Microsoftが画像生成・編集用の4Bネイティブ解像度モデル「Mage-Flow」をリリース
Microsoftは、効率的なテキストから画像への生成および指示ベースの画像編集のために設計されたコンパクトな4Bスケールの生成スタックであるMage-Flowをリリースした。このシステムは、軽量トークナイザーMage-VAEとネイティブ解像度マルチモーダル拡散トランスフォーマー(NR-MMDiT)の共同設計により、最先端に匹敵する品質を実現している。
SenseNovaがインフォグラフィックデザイン用のオープンソースSenseNova-U1-8b-MoTモデルをリリース
SenseNovaは、高密度なインフォグラフィックの生成と編集のために設計されたMixture of TransformersモデルのセットであるSenseNova-U1-8b-MoTシリーズをリリースしました。最新のリリースであるInfographic V2は、Apache 2ライセンスの下で提供される50ステップのベースモデルです。
AlibabaのAIモデルがHugging Faceで30億回のダウンロードを達成し、MetaやGoogleを凌駕
Hugging Faceによる「State of Open Models: Summer 2026 Observations」レポートによると、AlibabaのAIモデルはプラットフォーム上で累計30億回のダウンロードに達しました。このマイルストーンはオープンソースの状況における重要な転換点を示しており、Alibabaは総モデルダウンロード数においてMetaおよびGoogleをすでに上回っています。
Z.aiが拡張されたポストトレーニング付きGLM-5.3をリリース
Z.aiは、ベースモデルGLM-5.2のポストトレーニングを拡張することで、エージェント型コーディングベンチマークで最先端のパフォーマンスを達成する新モデルGLM-5.3を発表しました。約750Bパラメータを持つこのモデルは、現在Kimi K3を上回り、Claude Fable 5およびGPT-5.6-Solと同等かそれ以上の性能を各種ベンチマークで示しています。