Video generation
arxiv arXiv cs.AI · 5時間前 · 10 回表示

VideoX-Qwenが指示ベースのビデオ編集のためのデータ中心フレームワークを導入

研究者らは、汎用かつ指示駆動のビデオ編集を推進するために、スケーラブルなデータ構築とモデル学習を組み合わせた統合フレームワークであるVideoX-Qwenを発表しました。このシステムは、方向性編集レコードを生成するために特殊化されたモデルを整理する生産パイプラインを利用し、追加、削除、置換、属性タスクにわたって120万以上の高品質サンプルをもたらします。

lab NVIDIA Research · 8日前 · 15 回表示

FastGen-PDDが高速な動画・画像生成のための並列デコーディング蒸留を導入

研究者らが、拡散モデルやフローマッチングモデルの推論を加速するための簡素化された軌道ベース手法であるParallel Decoding Distillation (PDD)を紹介する。現在の手法が最適化が困難な変分スコア蒸留や敵対的損失に依存しているのに対し、PDDは1回のネットワーク評価で複数のノイズ除去ステップを予測する。

media Hugging Face Forums · 10日前 · 20 回表示

NanoAvatarがQualcomm QNN経由でAndroid上でローカルの話すアバターを可能にする

NanoAvatarは、クラウドGPUを必要とせずに、古いAndroidスマートフォンでリアルな話すアバターをローカルで実行するオープンソースプロジェクトです。リリースには公開コード、モデルの重み、およびユーザー独自の音声とのオフライン使用のためにモデルとアバターをバンドルしたAndroid APKが含まれています。

media Hugging Face Forums · 26日前 · 39 回表示

Seedance 2のテスト、カメラ移動と雰囲気での強みを明らかに

Seedance 2 AI動画生成モデルの評価は、以前の反復と比較して映画要素への理解が向上していることを強調しています。テストでは、モデルが視覚的な連続性と照明を適切に処理できる一方で、複雑なオブジェクトの一貫性やプロンプトの過負荷にはまだ課題があることが示されています。