Qwen、NVIDIA、Mistral、Black Forest Labsが新モデルをリリース;ルーティングと安全性に注目が集まる
2026年8月3日〜4日のAIニュースまとめでは、Alibaba Qwen、NVIDIA、Mistral AI、Black Forest Labsによる重要なモデルのリリースに加え、エージェントのルーティング、インフラストラクチャ、サイバーセキュリティの動向をカバーしています。
2026年8月3日〜4日のAIニュースまとめでは、Alibaba Qwen、NVIDIA、Mistral AI、Black Forest Labsによる重要なモデルのリリースに加え、エージェントのルーティング、インフラストラクチャ、サイバーセキュリティの動向をカバーしています。
MiniMaxは、テキスト、画像、動画、音声を単一のコンテキストに統合し、最大15秒の2K動画クリップをネイティブステレオ音声付きで生成する汎用マルチモーダル生成モデル「MiniMax H3」をリリースした。特定のタスク用に個別の専門モデルに依存する従来のスタックとは異なり、H3はユーザーが自然言語のプロンプトを通じて参照や編集関係を表現できる。
xAIは、テキスト、画像、音声の参照をサポートするようImagine Video 1.5モデルを更新し、ユーザーが最大1080p解像度の動画を生成できるようになりました。この更新により、シーン間で顔と声を固定してキャラクターの一貫性を保つことができ、1回の生成で最大7つの参照をサポートします。
MiniMaxは、テキスト、画像、動画、音声にわたる統一されたコンテキストを理解する汎用マルチモーダル生成モデル「MiniMax H3」をリリースしました。このモデルは、最大15秒の長さで2K解像度、ネイティブステレオサウンド付きの動画を生成します。
NVIDIAは、Cosmos-H-Surgical-Simulatorの能力を因果的な学生モデルに凝縮した、手術用ロボティクス向けのリアルタイムかつ行動条件付きの生成シミュレーターであるCosmos-H-Dreamsを発表しました。NVIDIAのFlashDreams加速ストリーミング推論ライブラリを通じて提供され、このシステムは閉ループ内での人間または学習されたポリシーによるインタラクティブな制御を可能にします。
Black Forest Labsは、単一のアーキテクチャ内で画像、動画、音声から学習するマルチモーダル基盤モデルであるFLUX 3をリリースしました。これは、1つの重みセットから動画、音声、動作の予測を出力する初のFLUXモデルです。
Black Forest Labsは、ネイティブオーディオのビデオ生成機能を含むマルチモーダルフローモデルファミリーであるFLUX 3をリリースしました。今回のリリースでは、ビデオアクションロボットアプリケーション用に設計されたバリアントであるFLUX-mimicも導入されています。
NVIDIAとHugging Faceは、NVIDIA NeMo Automodelを🤗 Diffusersライブラリと統合し、オープンソースの拡散モデルに対して本番環境対応の分散トレーニングを提供しました。この協力により、ユーザーはチェックポイントの変換やモデルコードの書き換えを行うことなく、Hugging Face Hub上のDiffusers形式のモデルをファインチューニングできます。
GoogleはGoogle Vidsに2つの新アップデートを導入した。テキストベースの動画生成・編集のためのGemini Omniの統合と、ユーザーがパーソナルなデジタルアバターを作成できる機能である。
モデルプロバイダーとしてKimi K3を使用して生成された viral video が共有され、創造的タスクにおけるその能力が示されています。クリエイターは、GLM 5.2を使用した以前の例と比較して、出力品質が大幅に向上したと感じていると述べています。
研究者は、振付を連続信号ではなくアトミックモーションのシーケンスとしてモデル化する、音楽駆動型ダンス生成のための構造認識フレームワークを発表した。
膨大な量の映像を知覚し、推論し、行動するビデオ分析AIエージェントは、既存のワークフローと統合されて初めて有用となります。これらのワークフローには、コンテンツ管理システム、メッセージングプラットフォーム、データベース、チケットキュー、エスカレーションパスが含まれます。
研究者らは、テキスト条件付き拡散モデルであるText2Signを発表した。これは1台のNVIDIA L4 GPUで短い手話クリップを生成するために設計されており、動画拡散モデルのトレーニングと評価に伴う高コストに対処する。本システムは、固定されたビジョン言語テキストエンコーダ、3Dエンコーダデコーダ、および因子化された時空間アテンションを組み合わせて、運動の一貫性を保ちつつ計算要件を削減している。
広大な空間でビデオ分析アプリケーションを構築する開発者は、カメラのビュー間で移動する同じオブジェクトを追跡する必要があります。単一カメラの2Dトラッキングは信頼性の高い深度情報を欠き、オブジェクトがフレームから外れたときに追跡を失うことが多く、倉庫の安全性、小売分析、スマートビルディング監視などのアプリケーションを制限します。
研究者らは、マルチボール硬球動力学シミュレーション中に因果連鎖が長くなるにつれてパフォーマンスが低下する「直列性ギャップ」をビデオ拡散モデルで特定した。制御実験により、この劣化はビデオの長さではなく依存事象構造に起因しており、相互作用のない単一ボールの制御では消失することが示された。
NVIDIAは、自律型コーディングAIエージェントを使用してVision reasoning modelであるCosmos 3をポストトレーニングすることで、最小限の手間で90%を超える精度を実現できることを示した。
研究者らは、音楽に同期した長時間・高精細なダンス動画を生成する階層型フレームワークであるWan-Dancerを発表しました。このシステムは、生成をグローバルなキーフレーム計画とローカルな時間的補正に分離することで、拡散モデルの典型的な20秒という制限を克服しています。
開発者のMorphLandは、ローカル大規模言語モデルを組み込んでゲーム内のNPCとして機能する無料Steamタイトル「Simulation Simulator」をリリースしました。このゲームは自由な会話体験で、プレイヤーはAIの相手が現実がシミュレーションであることを説得しようとします。