xAIがImagine Video 1.5に画像と音声参照を追加
xAIは、テキスト、画像、音声の参照をサポートするようImagine Video 1.5モデルを更新し、ユーザーが最大1080p解像度の動画を生成できるようになりました。この更新により、シーン間で顔と声を固定してキャラクターの一貫性を保つことができ、1回の生成で最大7つの参照をサポートします。
xAIは、テキスト、画像、音声の参照をサポートするようImagine Video 1.5モデルを更新し、ユーザーが最大1080p解像度の動画を生成できるようになりました。この更新により、シーン間で顔と声を固定してキャラクターの一貫性を保つことができ、1回の生成で最大7つの参照をサポートします。
GoogleはGoogle Vidsに2つの新アップデートを導入した。テキストベースの動画生成・編集のためのGemini Omniの統合と、ユーザーがパーソナルなデジタルアバターを作成できる機能である。
研究者たちは、タスクを時間条件付き潜在ドメイン変換として再構成することで、長時間のビデオリライティングにおける時間的不連続性に対処します。このフレームワークは、ターゲットドメインの潜在変数を境界間で伝播させることでチャンク間の連続性を強制し、マスクされたターゲットドメイン自己条件付けを使用して、この挙動を学習可能にします。
LTXは、動画生成、リアルタイムアプリケーション、物理AI向けのオープンウェイト・ワールドモデルであるLTX-2.5をリリースしました。これはNVIDIA RTX GPUおよびDGX Sparkハードウェアでのローカル推論に最適化されています。このリリースは、VRAM要件の削減と世代ごとの料金 elimination を目指し、動画制作をクラウドインフラからローカルのデスクトップへ移行させることを目的としています。
MiniMaxは、テキスト、画像、動画、オーディオを処理できるオープンウェイトのマルチモーダル動画生成モデル「MiniMax H3」をリリースしました。このモデルは、オーディオを後処理ステップとして追加するのではなく、視覚と同期したステレオオーディオ(会話、効果音、環境音、音楽を含む)を同時に生成します。
MiniMaxは、Hugging FaceでオープンウェイトのH3オムニモーダル動画生成モデルをリリースしました。このモデルはネイティブステレオオーディオを搭載し、単一フォワードパスで動画を駆動できます。モデルは5〜15秒のクリップに対して2K解像度・24fpsをサポートし、1回の生成あたり最大9枚の参照画像、3本の動画、3つのオーディオクリップを受け入れます。
2026年8月3日〜4日のAIニュースまとめでは、Alibaba Qwen、NVIDIA、Mistral AI、Black Forest Labsによる重要なモデルのリリースに加え、エージェントのルーティング、インフラストラクチャ、サイバーセキュリティの動向をカバーしています。
MiniMaxは、テキスト、画像、動画、音声を単一のコンテキストに統合し、最大15秒の2K動画クリップをネイティブステレオ音声付きで生成する汎用マルチモーダル生成モデル「MiniMax H3」をリリースした。特定のタスク用に個別の専門モデルに依存する従来のスタックとは異なり、H3はユーザーが自然言語のプロンプトを通じて参照や編集関係を表現できる。
MiniMaxは、テキスト、画像、動画、音声にわたる統一されたコンテキストを理解する汎用マルチモーダル生成モデル「MiniMax H3」をリリースしました。このモデルは、最大15秒の長さで2K解像度、ネイティブステレオサウンド付きの動画を生成します。
NVIDIAは、Cosmos-H-Surgical-Simulatorの能力を因果的な学生モデルに凝縮した、手術用ロボティクス向けのリアルタイムかつ行動条件付きの生成シミュレーターであるCosmos-H-Dreamsを発表しました。NVIDIAのFlashDreams加速ストリーミング推論ライブラリを通じて提供され、このシステムは閉ループ内での人間または学習されたポリシーによるインタラクティブな制御を可能にします。
Black Forest Labsは、単一のアーキテクチャ内で画像、動画、音声から学習するマルチモーダル基盤モデルであるFLUX 3をリリースしました。これは、1つの重みセットから動画、音声、動作の予測を出力する初のFLUXモデルです。
Black Forest Labsは、ネイティブオーディオのビデオ生成機能を含むマルチモーダルフローモデルファミリーであるFLUX 3をリリースしました。今回のリリースでは、ビデオアクションロボットアプリケーション用に設計されたバリアントであるFLUX-mimicも導入されています。
NVIDIAとHugging Faceは、NVIDIA NeMo Automodelを🤗 Diffusersライブラリと統合し、オープンソースの拡散モデルに対して本番環境対応の分散トレーニングを提供しました。この協力により、ユーザーはチェックポイントの変換やモデルコードの書き換えを行うことなく、Hugging Face Hub上のDiffusers形式のモデルをファインチューニングできます。
モデルプロバイダーとしてKimi K3を使用して生成された viral video が共有され、創造的タスクにおけるその能力が示されています。クリエイターは、GLM 5.2を使用した以前の例と比較して、出力品質が大幅に向上したと感じていると述べています。
膨大な量の映像を知覚し、推論し、行動するビデオ分析AIエージェントは、既存のワークフローと統合されて初めて有用となります。これらのワークフローには、コンテンツ管理システム、メッセージングプラットフォーム、データベース、チケットキュー、エスカレーションパスが含まれます。