invideo、GPT-6 Astraでカラーグレーディングを3倍改善
invideoは、エージェント型ビデオ編集機能を強化するためにGPT-6 Astraを活用し、カラーグレーディングの成功率を3倍に高め、1日で50件のカスタムエフェクトを生成しました。
invideoは、エージェント型ビデオ編集機能を強化するためにGPT-6 Astraを活用し、カラーグレーディングの成功率を3倍に高め、1日で50件のカスタムエフェクトを生成しました。
Higgsfield AIは、内部開発ワークフローを加速し、動画広告作成プラットフォームを強化するためにOpenAIのGPT-6 Astraモデルを統合しました。同社は、このモデルにより1人のエンジニアがわずか1日で新しい探索機能を提供できると報告しています。
研究者らが、拡散モデルやフローマッチングモデルの推論を加速するための簡素化された軌道ベース手法であるParallel Decoding Distillation (PDD)を紹介する。現在の手法が最適化が困難な変分スコア蒸留や敵対的損失に依存しているのに対し、PDDは1回のネットワーク評価で複数のノイズ除去ステップを予測する。
2026年9月初頭、NvidiaはHugging Faceを129億3000万ドルで買収することを発表し、OpenAIはGPT-6 Astraをリリース、Microsoftは音声認識モデルMAI-Transcribe-2をローンチしました。
NVIDIA、MIT、オックスフォード大学の研究者らは、自己進化型の物理言語をキャプションに統合することで動画の世界モデルを強化するフレームワーク「Physis-Lang」を発表した。この手法は、生成された動画の物理エラーを修正するために、データ選別、モデル学習、推論に使用される最適化可能な表現として物理言語を取り扱う。
Google Researchは、アイデンティティのドリフトやマルチショットパイプラインで一般的に発生するカスケードエラーに対処することで、一貫性のある数分間の動画を生成するために設計された4つのエージェント型フレームワークからなるAI動画共同ディレクターを導入しました。このシステムはGeminiとVeoの上にモデル非依存のオーケストレーションレイヤーとして動作し、出力にはSynthID透かしを利用します。
Runwayは、自己回帰型拡散モデルを用いて高忠実度の動画・音声生成をリアルタイムのインタラクティブシミュレーションに変換する研究プレビュー「GWM Worlds 2」を発表した。今回のリリースでは、ユーザーが環境の側面を固定し、タイムスタンプ付きのイベントを作成することで生成される世界やアクションを指定できる新しい入力形式「WorldPrompt」が特徴として含まれている。
研究者らは、汎用かつ指示駆動のビデオ編集を推進するために、スケーラブルなデータ構築とモデル学習を組み合わせた統合フレームワークであるVideoX-Qwenを発表しました。このシステムは、方向性編集レコードを生成するために特殊化されたモデルを整理する生産パイプラインを利用し、追加、削除、置換、属性タスクにわたって120万以上の高品質サンプルをもたらします。
NanoAvatarは、クラウドGPUを必要とせずに、古いAndroidスマートフォンでリアルな話すアバターをローカルで実行するオープンソースプロジェクトです。リリースには公開コード、モデルの重み、およびユーザー独自の音声とのオフライン使用のためにモデルとアバターをバンドルしたAndroid APKが含まれています。
Vidu S2には、リアルタイムインタラクティブデジタルキャラクターモデルのVidu S2-Avatarと、リアルタイムビデオ編集モデルのVidu S2-Editingが含まれます。システムは、両方のコンポーネントに対するリアルタイム空間ビデオ生成の実現可能性も探求しています。
あるユーザーが、新しくリリースされた DeepSeek V4.1 Flash モデルを使用して生成された動画を公開し、モーションビデオ合成におけるその能力をベンチマークしました。
あるユーザーが、Seedance および他のモデルへのアクセスを提供する AIide API プラットフォームを利用し、AI 生成ビデオの作成に Seedance 2.5 を実験的に使用しています。
ユーザーは、単一のキャラクターがさまざまな衣装、構図、ビジュアルスタイルで登場する短いファッションおよびエディトリアルシーケンスを使用して、Seedance 2.5 動画生成モデルをテストしました。