トピック · Video generation
lab NVIDIA Research · 13時間前 · 9 回表示

HorizonRelightはマスクされた自己条件付けを使用して、長時間のビデオリライティングの一貫性を達成

研究者たちは、タスクを時間条件付き潜在ドメイン変換として再構成することで、長時間のビデオリライティングにおける時間的不連続性に対処します。このフレームワークは、ターゲットドメインの潜在変数を境界間で伝播させることでチャンク間の連続性を強制し、マスクされたターゲットドメイン自己条件付けを使用して、この挙動を学習可能にします。

media MarkTechPost · 3日前 · 7 回表示

LTXがローカル動画生成用のオープンウェイト・ワールドモデル「LTX-2.5」をリリース

LTXは、動画生成、リアルタイムアプリケーション、物理AI向けのオープンウェイト・ワールドモデルであるLTX-2.5をリリースしました。これはNVIDIA RTX GPUおよびDGX Sparkハードウェアでのローカル推論に最適化されています。このリリースは、VRAM要件の削減と世代ごとの料金 elimination を目指し、動画制作をクラウドインフラからローカルのデスクトップへ移行させることを目的としています。

media r/LocalLLaMA · 5日前 · 11 回表示

MiniMaxが同期オーディオ付きのオープンウェイトH3ビデオモデルをリリース

MiniMaxは、テキスト、画像、動画、オーディオを処理できるオープンウェイトのマルチモーダル動画生成モデル「MiniMax H3」をリリースしました。このモデルは、オーディオを後処理ステップとして追加するのではなく、視覚と同期したステレオオーディオ(会話、効果音、環境音、音楽を含む)を同時に生成します。

media r/LocalLLaMA · 5日前 · 9 回表示

MiniMaxがネイティブステレオオーディオ付きのオープンウェイトH3動画生成モデルをリリース

MiniMaxは、Hugging FaceでオープンウェイトのH3オムニモーダル動画生成モデルをリリースしました。このモデルはネイティブステレオオーディオを搭載し、単一フォワードパスで動画を駆動できます。モデルは5〜15秒のクリップに対して2K解像度・24fpsをサポートし、1回の生成あたり最大9枚の参照画像、3本の動画、3つのオーディオクリップを受け入れます。

media MarkTechPost · 14日前 · 17 回表示

MiniMaxが2Kクリップとネイティブステレオ音声を生成するオムニモーダルビデオモデル「MiniMax H3」をリリース

MiniMaxは、テキスト、画像、動画、音声を単一のコンテキストに統合し、最大15秒の2K動画クリップをネイティブステレオ音声付きで生成する汎用マルチモーダル生成モデル「MiniMax H3」をリリースした。特定のタスク用に個別の専門モデルに依存する従来のスタックとは異なり、H3はユーザーが自然言語のプロンプトを通じて参照や編集関係を表現できる。

lab Hugging Face Blog · 19日前 · 23 回表示

NVIDIAが手術用ロボティクス向けのリアルタイム生成シミュレーター「Cosmos-H-Dreams」を発表

NVIDIAは、Cosmos-H-Surgical-Simulatorの能力を因果的な学生モデルに凝縮した、手術用ロボティクス向けのリアルタイムかつ行動条件付きの生成シミュレーターであるCosmos-H-Dreamsを発表しました。NVIDIAのFlashDreams加速ストリーミング推論ライブラリを通じて提供され、このシステムは閉ループ内での人間または学習されたポリシーによるインタラクティブな制御を可能にします。

media Latent Space · 22日前 · 8 回表示

Black Forest LabsがFLUX 3マルチモーダルフローモデルとFLUX-mimicロボットモデルをリリース

Black Forest Labsは、ネイティブオーディオのビデオ生成機能を含むマルチモーダルフローモデルファミリーであるFLUX 3をリリースしました。今回のリリースでは、ビデオアクションロボットアプリケーション用に設計されたバリアントであるFLUX-mimicも導入されています。

lab Hugging Face Blog · 28日前 · 5 回表示

NVIDIA NeMo AutomodelがHugging Face Diffusersと連携し、分散型拡散モデルのファインチューニングを実現

NVIDIAとHugging Faceは、NVIDIA NeMo Automodelを🤗 Diffusersライブラリと統合し、オープンソースの拡散モデルに対して本番環境対応の分散トレーニングを提供しました。この協力により、ユーザーはチェックポイントの変換やモデルコードの書き換えを行うことなく、Hugging Face Hub上のDiffusers形式のモデルをファインチューニングできます。

lab NVIDIA Technical Blog · 30日前 · 1 回表示

NVIDIA、エンタープライズワークフローへのコンテキスト対応ビデオAIエージェントの統合について議論

膨大な量の映像を知覚し、推論し、行動するビデオ分析AIエージェントは、既存のワークフローと統合されて初めて有用となります。これらのワークフローには、コンテンツ管理システム、メッセージングプラットフォーム、データベース、チケットキュー、エスカレーションパスが含まれます。