XiaomiがMiMo-V2.6 ProおよびFlashモデルをオープンソース化
Xiaomiは、インタラクティブな3Dシーンの構築と視覚的テストのためにエージェントを調整するために設計されたオムニモーダルモデルのMiMo-V2.6 ProおよびFlashをオープンソース化しました。これらのモデルはBlenderアセットを生成し、カメラフィードからロボットアームを制御し、フロントエンドやプレゼンテーションを作成し、ビデオを組み立て、スコアとMIDIとして音楽を作曲できます。
Xiaomiは、インタラクティブな3Dシーンの構築と視覚的テストのためにエージェントを調整するために設計されたオムニモーダルモデルのMiMo-V2.6 ProおよびFlashをオープンソース化しました。これらのモデルはBlenderアセットを生成し、カメラフィードからロボットアームを制御し、フロントエンドやプレゼンテーションを作成し、ビデオを組み立て、スコアとMIDIとして音楽を作曲できます。
AntLingは、2つの6Bパラメータモデル(Ming-Image-0.1-DesignとMing-Image-0.1-Design-Layer)を含むMing-Image-0.1-Designファミリーをリリースしました。
XiaomiはMiMo-V2.6シリーズをリリースし、MiMo-V2.6-ProやMiMo-V2.6-Flashなど、ネイティブにオムニモーダルなモデルを導入した。同社はまた、同等の品質で最大20倍の高速出力を実現するMiMo-V2.6-Pro-UltraSpeedも発表した。
AWS Strands Agentsチームは、PythonおよびTypeScript向けにApache 2.0ライセンスで提供されるオープンソースの汎用エージェントハーネスであるStrands Harnessをリリースしました。このツールは、Claude CodeやCodexのような環境でエージェントのプロトタイピングを行うことと、カスタムループでのデプロイメントの間のギャップを埋めるために設計されています。
Microsoft Researchは、逆合成予測のための新しいフレームワークであるRetroChimeraを公開し、オープンソース化した。このフレームワークは2つの補完的なモデルを組み合わせて、高品質な合成経路を提案する。システムは、TransformerベースのデノボモデルであるR-SMILES 2と、グラフニューラルネットワーク(GNN)ベースのモデルであるNeuralLocを、学習されたアンサンブル戦略を用いて統合し、予測結果をランク付けする。
アリババのQwenチームは、以前の個別チェックポイントを単一の7Bパラメータ拡散トランスフォーマーに統合した、テキストから画像への生成および画像編集用の統一モデルであるQwen-Image-2.1をリリースしました。
tokenizersライブラリは、テキストエンコーディングのパフォーマンスを大幅に改善し、トレーニングおよびサービングワークフローにおけるボトルネックに対処するバージョン1のリリース候補をリリースしました。このアップデートはv0.23とのAPI互換性を維持しつつ、10のモデルファミリー全体で著しい速度向上をもたらします。
Multiverseは、大規模言語モデルのプルーニングをイジングガラスにマッピングされた制約付き二値最適化問題として再構成する方法を詳述した論文を発表した。損失ヘッシアンから導出されたペアワイズ結合を持つスピンとしてトランスフォーマーブロックを扱うことで、この手法は反復的なベンチマークを必要とせずに最適なブロック除去構成を特定する。
著者はオープンウェイトモデルの現状に関するブリーフィングを提示し、2025年4月頃以降、中国のAI企業がこの分野で明確なリーダーとなっていることを指摘している。この変化は、Hugging Faceのダウンロード指標と能力ベンチマークでのパフォーマンスによって裏付けられている。
Qwenは、画像生成と編集の両方に設計された統一モデルであるオープンウェイトのQwen-Image-2.1をリリースしました。
StepfunはStep 5 Preview 600B-A27Bモデルをリリースし、現在その製品およびAPIを通じて利用可能です。 このモデルのオープンウェイト版は10月15日にリリースされます。
リポジトリ stepfun-ai/Step-5-Preview-BF16 が Hugging Face に公開されました。提出タイトルは、このモデルが有望であることを示しています。
Stepfunの新モデル「Step 5」のプレビューがオンラインで流出しました。
アリババは、がんと約150の他の医療状態を検出できるオープンソースの医療人工知能モデルをリリースしました。
inclusionAIはHugging Face上でRealtime-Venusシステムを公開し、2つのチェックポイント(Realtime-Venus-OmniとRealtime-Venus-Audio)を搭載しています。OmniチェックポイントはMiniCPM-o 4.5から適応された9Bオーディオビジュアル対話モデルで、継続的に視聴し、応答するタイミングを判断します。
清華大学の戴繼峰教授によって設立されたシークレットスタートアップのNaive AIは、総額4億ドルの3回の資金調達ラウンドを完了し、評価額が14億ドルを超えました。同社は、今月にもオープンウェイトリリースとして初の大型言語モデル「Naive」をリリースする準備をしています。
Tencentは、Qwen3-VLモデルからファインチューニングされたページ画像用のエンドツーエンドのドキュメントパーサーであるWeVisDocをリリースしました。このシステムは、LaTeX数式やHTMLテーブルを含む構造化されたMarkdownにページ画像を変換します。
Tencentは、ページ画像用のエンドツーエンドのドキュメントパーサーであるWeVisDoc-4Bをリリースしました。これは、LaTeX数式とHTMLテーブルを含む構造化されたMarkdownにページを変換します。Qwen3-VL-4B-Instructからファインチューニングされ、OmniDocBench v1.6で総合スコア95.38を達成し、報告されたすべての4つの設定において比較されたパーサーの中で1位となりました。
Togetherは、エンタープライズが管理型サービスを使用してクローズドソースのAIモデルからオープンソースモデル(OSM)へ移行するためのフレームワークを提供しており、複雑さを軽減し採用を加速することを目指しています。このプロセスには、ベンチマークを通じて適切なモデルを発見し、トラフィックリプレイで評価し、プロンプトや重みを適応させ、ROIを計算して切り替えを正当化することが含まれます。
Mozillaのレポートによると、中国のオープンウェイトAIモデルの開発ギャップは米国最先端製品に対してわずか4ヶ月にまで縮小した。この急速な進歩にもかかわらず、モデルはいくつかのベンチマーク評価で依然として遅れを取っている。