トピック · Video generation
lab NVIDIA Research · 16日前 · 20 回表示

FastGen-PDDが高速な動画・画像生成のための並列デコーディング蒸留を導入

研究者らが、拡散モデルやフローマッチングモデルの推論を加速するための簡素化された軌道ベース手法であるParallel Decoding Distillation (PDD)を紹介する。現在の手法が最適化が困難な変分スコア蒸留や敵対的損失に依存しているのに対し、PDDは1回のネットワーク評価で複数のノイズ除去ステップを予測する。

media MarkTechPost · 7時間前

NVIDIAの研究者がCosmos 3動画モデルの物理推論を改善するPhysis-Langを公開

NVIDIA、MIT、オックスフォード大学の研究者らは、自己進化型の物理言語をキャプションに統合することで動画の世界モデルを強化するフレームワーク「Physis-Lang」を発表した。この手法は、生成された動画の物理エラーを修正するために、データ選別、モデル学習、推論に使用される最適化可能な表現として物理言語を取り扱う。

media MarkTechPost · 3日前 · 11 回表示

Google Researchが、一貫性のある数分間の動画生成のための4つのエージェント型フレームワークを導入

Google Researchは、アイデンティティのドリフトやマルチショットパイプラインで一般的に発生するカスケードエラーに対処することで、一貫性のある数分間の動画を生成するために設計された4つのエージェント型フレームワークからなるAI動画共同ディレクターを導入しました。このシステムはGeminiとVeoの上にモデル非依存のオーケストレーションレイヤーとして動作し、出力にはSynthID透かしを利用します。

media Latent Space · 6日前 · 11 回表示

Runwayがリアルタイムインタラクティブな世界生成のためのWorldPromptを発表

Runwayは、自己回帰型拡散モデルを用いて高忠実度の動画・音声生成をリアルタイムのインタラクティブシミュレーションに変換する研究プレビュー「GWM Worlds 2」を発表した。今回のリリースでは、ユーザーが環境の側面を固定し、タイムスタンプ付きのイベントを作成することで生成される世界やアクションを指定できる新しい入力形式「WorldPrompt」が特徴として含まれている。

arxiv arXiv cs.AI · 8日前 · 17 回表示

VideoX-Qwenが指示ベースのビデオ編集のためのデータ中心フレームワークを導入

研究者らは、汎用かつ指示駆動のビデオ編集を推進するために、スケーラブルなデータ構築とモデル学習を組み合わせた統合フレームワークであるVideoX-Qwenを発表しました。このシステムは、方向性編集レコードを生成するために特殊化されたモデルを整理する生産パイプラインを利用し、追加、削除、置換、属性タスクにわたって120万以上の高品質サンプルをもたらします。

media Hugging Face Forums · 17日前 · 26 回表示

NanoAvatarがQualcomm QNN経由でAndroid上でローカルの話すアバターを可能にする

NanoAvatarは、クラウドGPUを必要とせずに、古いAndroidスマートフォンでリアルな話すアバターをローカルで実行するオープンソースプロジェクトです。リリースには公開コード、モデルの重み、およびユーザー独自の音声とのオフライン使用のためにモデルとアバターをバンドルしたAndroid APKが含まれています。