Video generation
media MarkTechPost · 8日前 · 15 回表示

MiniMaxが2Kクリップとネイティブステレオ音声を生成するオムニモーダルビデオモデル「MiniMax H3」をリリース

MiniMaxは、テキスト、画像、動画、音声を単一のコンテキストに統合し、最大15秒の2K動画クリップをネイティブステレオ音声付きで生成する汎用マルチモーダル生成モデル「MiniMax H3」をリリースした。特定のタスク用に個別の専門モデルに依存する従来のスタックとは異なり、H3はユーザーが自然言語のプロンプトを通じて参照や編集関係を表現できる。

lab Hugging Face Blog · 13日前 · 19 回表示

NVIDIAが手術用ロボティクス向けのリアルタイム生成シミュレーター「Cosmos-H-Dreams」を発表

NVIDIAは、Cosmos-H-Surgical-Simulatorの能力を因果的な学生モデルに凝縮した、手術用ロボティクス向けのリアルタイムかつ行動条件付きの生成シミュレーターであるCosmos-H-Dreamsを発表しました。NVIDIAのFlashDreams加速ストリーミング推論ライブラリを通じて提供され、このシステムは閉ループ内での人間または学習されたポリシーによるインタラクティブな制御を可能にします。

media Latent Space · 16日前 · 4 回表示

Black Forest LabsがFLUX 3マルチモーダルフローモデルとFLUX-mimicロボットモデルをリリース

Black Forest Labsは、ネイティブオーディオのビデオ生成機能を含むマルチモーダルフローモデルファミリーであるFLUX 3をリリースしました。今回のリリースでは、ビデオアクションロボットアプリケーション用に設計されたバリアントであるFLUX-mimicも導入されています。

lab Hugging Face Blog · 23日前 · 5 回表示

NVIDIA NeMo AutomodelがHugging Face Diffusersと連携し、分散型拡散モデルのファインチューニングを実現

NVIDIAとHugging Faceは、NVIDIA NeMo Automodelを🤗 Diffusersライブラリと統合し、オープンソースの拡散モデルに対して本番環境対応の分散トレーニングを提供しました。この協力により、ユーザーはチェックポイントの変換やモデルコードの書き換えを行うことなく、Hugging Face Hub上のDiffusers形式のモデルをファインチューニングできます。

lab NVIDIA Technical Blog · 24日前

NVIDIA、エンタープライズワークフローへのコンテキスト対応ビデオAIエージェントの統合について議論

膨大な量の映像を知覚し、推論し、行動するビデオ分析AIエージェントは、既存のワークフローと統合されて初めて有用となります。これらのワークフローには、コンテンツ管理システム、メッセージングプラットフォーム、データベース、チケットキュー、エスカレーションパスが含まれます。

arxiv arXiv cs.CL · 24日前

Text2Sign: テキストから手話動画生成のための単一GPU拡散ベースライン

研究者らは、テキスト条件付き拡散モデルであるText2Signを発表した。これは1台のNVIDIA L4 GPUで短い手話クリップを生成するために設計されており、動画拡散モデルのトレーニングと評価に伴う高コストに対処する。本システムは、固定されたビジョン言語テキストエンコーダ、3Dエンコーダデコーダ、および因子化された時空間アテンションを組み合わせて、運動の一貫性を保ちつつ計算要件を削減している。

lab NVIDIA Technical Blog · 24日前

NVIDIA DeepStream 9.1がマルチカメラ3Dトラッキングを実現

広大な空間でビデオ分析アプリケーションを構築する開発者は、カメラのビュー間で移動する同じオブジェクトを追跡する必要があります。単一カメラの2Dトラッキングは信頼性の高い深度情報を欠き、オブジェクトがフレームから外れたときに追跡を失うことが多く、倉庫の安全性、小売分析、スマートビルディング監視などのアプリケーションを制限します。

arxiv arXiv cs.LG · 25日前

ビデオ拡散モデルにおける直列性ギャップ

研究者らは、マルチボール硬球動力学シミュレーション中に因果連鎖が長くなるにつれてパフォーマンスが低下する「直列性ギャップ」をビデオ拡散モデルで特定した。制御実験により、この劣化はビデオの長さではなく依存事象構造に起因しており、相互作用のない単一ボールの制御では消失することが示された。

media r/LocalLLaMA · 26日前 · 1 回表示

Wan-Dancerが分単位の一貫性のある音楽からダンス動画の生成を実現

研究者らは、音楽に同期した長時間・高精細なダンス動画を生成する階層型フレームワークであるWan-Dancerを発表しました。このシステムは、生成をグローバルなキーフレーム計画とローカルな時間的補正に分離することで、拡散モデルの典型的な20秒という制限を克服しています。