HorizonRelightはマスクされた自己条件付けを使用して、長時間のビデオリライティングの一貫性を達成
研究者たちは、タスクを時間条件付き潜在ドメイン変換として再構成することで、長時間のビデオリライティングにおける時間的不連続性に対処します。このフレームワークは、ターゲットドメインの潜在変数を境界間で伝播させることでチャンク間の連続性を強制し、マスクされたターゲットドメイン自己条件付けを使用して、この挙動を学習可能にします。
研究者たちは、タスクを時間条件付き潜在ドメイン変換として再構成することで、長時間のビデオリライティングにおける時間的不連続性に対処します。このフレームワークは、ターゲットドメインの潜在変数を境界間で伝播させることでチャンク間の連続性を強制し、マスクされたターゲットドメイン自己条件付けを使用して、この挙動を学習可能にします。
Nvidiaの研究者らは、物理的に妥当な照明転送とアイデンティティの保持、コンパクトなリアルタイム推論を組み合わせるポートレート再照明手法であるFusionRelightを導入した。このアプローチは、合成データ、One-Light-at-a-Time (OLAT)、および野外データから物理学、反射率、リアリティの事前知識を学生モデルに蒸留するトレーニングフレームワークであるハイブリッドドメイン知識融合(HDKF)を利用している。
NVIDIAは、クローズドループシミュレーションにおける自動運転ポリシーの評価におけるボトルネックに対処するために設計された基盤生成型世界モデル「OmniDreams」を発表した。Cosmos拡散モデルを21,000時間の運転シナリオでミッドトレーニングおよびポストトレーニングし、リアルタイムでアクション条件付きの動画を自己回帰的に生成する。
NVIDIAの研究チームは、マルチモーダル大規模言語モデル(MLLMs)の空間知能を分解するために設計された診断フレームワークであるSpatial-IQを発表しました。既存のベンチマークがモデルをブラックボックスとして扱うのとは異なり、このアプローチは、積み重ねられた3D構造における物体数え上げを、人間の発達段階と一致する9つの知覚・認知サブタスクに分解します。
研究者らは、ガウスプリミティブベースの画像圧縮におけるレート歪み性能を向上させるために設計されたCluster-Guided Vector Quantization (CGVQ)を発表します。このアプローチは、量子化の前にガウスパラメータを均質なグループに分割し、各プリミティブあたりの大量の浮動小数点パラメータの保存による非効率性を解決します。
研究者は競技シューティングゲーム『Delta Force』のゲームプレイ動画を分析し、ジェスチャーや移動パターンなどの emergent な非言語コミュニケーションを抽出・理解しています。この研究は、主にMOBAゲームや他のシューターにおける verbal coordination に焦点を当てていた先行研究の gap を埋めるものです。
NVIDIAの研究者たちは、競争的なグループプレイのスケジュール調整やラボ環境の再現の難しさを解決するため、フィールド実験の方法論を採用しています。このアプローチは実験を大会構造に直接統合し、ハイブリッドな大会-実験を作成します。
研究者らは、The AI Telco Engineer (AITE)を発表しました。これは、パフォーマンスと複雑さのトレードオフを考慮しながら、大規模言語モデル駆動の進化検索を用いて複雑な通信問題のアルゴリズムを自律的に設計するフレームワークです。
NVIDIAは、インタラクティブなゲーム環境内で生成AIシステムを制御するという課題に対処するために設計されたフレームワークであるCTRL-G(Controllable Generative Graphics for Games)を発表しました。
Anthropicは、Claude Fable 5の能力に迫りながら半分の価格で提供されるより効率的なモデルとしてClaude Opus 5を発表し、Claude Maxのデフォルトモデルとなった。同時に、NVIDIAは革新を促進し、米国が同分野でのリーダーシップを強化するため、オープンウェイトAIモデルをサポートする米政府の政策を提唱している。
NVIDIAは、メモリ制約のあるエッジシステムでデータセンターレベルのパフォーマンスを提供するために設計された40億パラメータのオープンワールドモデルであるCosmos 3 Edgeをリリースしました。このモデルにより、ロボットやビジョンAIエージェントは周囲の環境を理解し、リアルタイムで推論を行い、NVIDIA Jetsonモジュールなどのデバイス上で直接アクションを生成することが可能になります。
NVIDIAは、生産規模のRAG、エージェント型検索、コード検索、エージェントメモリのための検索品質を向上させるために設計された、オープンかつ商用利用可能な埋め込みモデルのコレクションであるNemotron 3 Embedをリリースしました。このコレクションには、RTEBリーダーボードで総合1位を獲得した8Bモデルと、デプロイメント用に最適化された効率的な1Bバリエーションが含まれています。
llama.cppプロジェクトは、OpenVINOバックエンドへの重要な更新をマージしました。主な変更点として、Qwen3.5モデルファミリーのサポート有効化と、いくつかのメモリ最適化技術の導入が含まれます。
アリババは、オープンエコシステムに最前線に近い能力をもたらすために設計された、最大のオープンウェイトモデルであるQwen3.8-2.4T-A95B(Qwen3.8-Maxとしても知られる)のオープンウェイトをリリースしました。
NVIDIAは、常時稼働するAIエージェントの構築のために設計された2つのオープンソースアーティファクト——Nemotron 3.5 LightningモデルとNeMo Switchyardルーティングライブラリ——をリリースした。これらのツールは、長時間実行されるエージェントワークフローのすべてのステップをフロンティア推論モデルに送信することに伴う高コストとレイテンシーの問題に対し、専門的な実行およびルーティング機能を提供することで対処している。
NVIDIA は Hugging Face に Nemotron-3.5-Lightning-30B-A3B モデルをリリースしました。
NVIDIAはMagpie多言語TTSモデルのアップデートをリリースし、現代標準アラビア語、韓国語、ブラジルポルトガル語の追加により12言語へのサポートを拡大した。今回のリリースでは、更新されたトレーニングデータとアーキテクチャの変更を通じて既存言語の品質も改善されている。
Metaは、ローカルAIエージェントワーク用に設計された120K+のコンテキストウィンドウを持つ30Bのパラメータを持つ密集モデル「Muse Glimmer」をリリースしました。NVIDIAのエッジ、デスクトップ、ワークステーションプラットフォームで実行するように最適化されており、単一のGPUで20Kトークン/秒の処理速度を実現します。
NVIDIAは、リアルタイムのフルデュプレックス会話のために設計されたオープンな11Bパラメータのエンドツーエンド音声対話モデルであるNemotronLabs VoiceChat 11Bをリリースした。ASR、LLM、TTSをチェーンするカスケード型スタックとは異なり、この統合ネットワークはストリーミング音声の理解と生成を同時に実行し、Full-Duplex-Bench 1.0で測定されたスムーズなターンテイクレイテンシ448msを達成した。
NVIDIA Labsは、モデル非依存のPythonフレームワークであるNOOA(NVIDIA Object-Oriented Agents)をオープンソース化しました。このフレームワークは、エージェント開発を単一のPythonクラスに集約します。このアプローチは、プロンプトテンプレートやワークフローグラフを含む断片化したワークフローに取って代わり、メソッドをアクションに、フィールドを状態に、docstringsをプロンプトに、型注釈を強制された契約にマッピングします。