VideoX-Qwenが指示ベースのビデオ編集のためのデータ中心フレームワークを導入
研究者らは、汎用かつ指示駆動のビデオ編集を推進するために、スケーラブルなデータ構築とモデル学習を組み合わせた統合フレームワークであるVideoX-Qwenを発表しました。このシステムは、方向性編集レコードを生成するために特殊化されたモデルを整理する生産パイプラインを利用し、追加、削除、置換、属性タスクにわたって120万以上の高品質サンプルをもたらします。
研究者らは、汎用かつ指示駆動のビデオ編集を推進するために、スケーラブルなデータ構築とモデル学習を組み合わせた統合フレームワークであるVideoX-Qwenを発表しました。このシステムは、方向性編集レコードを生成するために特殊化されたモデルを整理する生産パイプラインを利用し、追加、削除、置換、属性タスクにわたって120万以上の高品質サンプルをもたらします。
Higgsfield AIは、内部開発ワークフローを加速し、動画広告作成プラットフォームを強化するためにOpenAIのGPT-6 Astraモデルを統合しました。同社は、このモデルにより1人のエンジニアがわずか1日で新しい探索機能を提供できると報告しています。
研究者らが、拡散モデルやフローマッチングモデルの推論を加速するための簡素化された軌道ベース手法であるParallel Decoding Distillation (PDD)を紹介する。現在の手法が最適化が困難な変分スコア蒸留や敵対的損失に依存しているのに対し、PDDは1回のネットワーク評価で複数のノイズ除去ステップを予測する。
NanoAvatarは、クラウドGPUを必要とせずに、古いAndroidスマートフォンでリアルな話すアバターをローカルで実行するオープンソースプロジェクトです。リリースには公開コード、モデルの重み、およびユーザー独自の音声とのオフライン使用のためにモデルとアバターをバンドルしたAndroid APKが含まれています。
Vidu S2には、リアルタイムインタラクティブデジタルキャラクターモデルのVidu S2-Avatarと、リアルタイムビデオ編集モデルのVidu S2-Editingが含まれます。システムは、両方のコンポーネントに対するリアルタイム空間ビデオ生成の実現可能性も探求しています。
あるユーザーが、新しくリリースされた DeepSeek V4.1 Flash モデルを使用して生成された動画を公開し、モーションビデオ合成におけるその能力をベンチマークしました。
あるユーザーが、Seedance および他のモデルへのアクセスを提供する AIide API プラットフォームを利用し、AI 生成ビデオの作成に Seedance 2.5 を実験的に使用しています。
ユーザーは、単一のキャラクターがさまざまな衣装、構図、ビジュアルスタイルで登場する短いファッションおよびエディトリアルシーケンスを使用して、Seedance 2.5 動画生成モデルをテストしました。
2026年9月初頭、NvidiaはHugging Faceを129億3000万ドルで買収することを発表し、OpenAIはGPT-6 Astraをリリース、Microsoftは音声認識モデルMAI-Transcribe-2をローンチしました。
あるユーザーは、シーケンス全体で視覚的な一貫性を維持する能力を評価するために、短いファッションおよびエディトリアルスタイルの動画コンセプトを使用して Seedance 2.5 モデルをテストしました。
Googleは、ネイティブなマルチモーダル動画生成モデルであるGemini Omni 1.1 Flashをリリースしました。これは単なる生成から直接操作可能な編集へと焦点を移した、本番環境向けのアップデートです。
Google は、Gemini API を介してシーン拡張、最初と最後のフレームの補間、4K アップスケール、およびより高速なビデオ反復のための新しい制御機能を備えた Gemini Omni 1.1 Flash を発表しました。
Seedance 2 AI動画生成モデルの評価は、以前の反復と比較して映画要素への理解が向上していることを強調しています。テストでは、モデルが視覚的な連続性と照明を適切に処理できる一方で、複雑なオブジェクトの一貫性やプロンプトの過負荷にはまだ課題があることが示されています。
OpenAIのチーフサイエンティストであるJakub Pachocki氏は、未公開のAstraモデルが2026年9月までに「自動AI研究インターン」となることを目指していると述べ、CEOのSam Altman氏は同社が2026年12月までに内部でAGIの達成を発表すると推定している。
Googleは、Gemini APIを通じてGoogle AI Studioでプロフェッショナルな用途に本番環境対応させるために設計された、クリエイティブな制御機能と生成型ビデオ能力の新スイートであるGemini Omni 1.1 Flashを発表しました。