ラボ · NVIDIA
lab NVIDIA Research · 4時間前 · 1 回表示

HorizonRelightはマスクされた自己条件付けを使用して、長時間のビデオリライティングの一貫性を達成

研究者たちは、タスクを時間条件付き潜在ドメイン変換として再構成することで、長時間のビデオリライティングにおける時間的不連続性に対処します。このフレームワークは、ターゲットドメインの潜在変数を境界間で伝播させることでチャンク間の連続性を強制し、マスクされたターゲットドメイン自己条件付けを使用して、この挙動を学習可能にします。

lab NVIDIA Research · 4時間前 · 2 回表示

Nvidia、ハイブリッドドメイン知識融合によるリアルタイムポートレート再照明手法「FusionRelight」を発表

Nvidiaの研究者らは、物理的に妥当な照明転送とアイデンティティの保持、コンパクトなリアルタイム推論を組み合わせるポートレート再照明手法であるFusionRelightを導入した。このアプローチは、合成データ、One-Light-at-a-Time (OLAT)、および野外データから物理学、反射率、リアリティの事前知識を学生モデルに蒸留するトレーニングフレームワークであるハイブリッドドメイン知識融合(HDKF)を利用している。

lab NVIDIA Research · 3日前 · 10 回表示

NVIDIAが自動運転シミュレーション向けリアルタイム生成型世界モデル「OmniDreams」をリリース

NVIDIAは、クローズドループシミュレーションにおける自動運転ポリシーの評価におけるボトルネックに対処するために設計された基盤生成型世界モデル「OmniDreams」を発表した。Cosmos拡散モデルを21,000時間の運転シナリオでミッドトレーニングおよびポストトレーニングし、リアルタイムでアクション条件付きの動画を自己回帰的に生成する。

lab NVIDIA Research · 18日前 · 9 回表示

NVIDIA、マルチモーダルモデルの空間推論のための階層的診断フレームワーク「Spatial-IQ」を発表

NVIDIAの研究チームは、マルチモーダル大規模言語モデル(MLLMs)の空間知能を分解するために設計された診断フレームワークであるSpatial-IQを発表しました。既存のベンチマークがモデルをブラックボックスとして扱うのとは異なり、このアプローチは、積み重ねられた3D構造における物体数え上げを、人間の発達段階と一致する9つの知覚・認知サブタスクに分解します。

lab NVIDIA Research · 18日前 · 13 回表示

2Dガウスベース画像圧縮のためのクラスター化コードブック量子化

研究者らは、ガウスプリミティブベースの画像圧縮におけるレート歪み性能を向上させるために設計されたCluster-Guided Vector Quantization (CGVQ)を発表します。このアプローチは、量子化の前にガウスパラメータを均質なグループに分割し、各プリミティブあたりの大量の浮動小数点パラメータの保存による非効率性を解決します。

lab NVIDIA Research · 18日前 · 7 回表示

Delta Forceにおける非言語コミュニケーションのマルチモーダルAI分析

研究者は競技シューティングゲーム『Delta Force』のゲームプレイ動画を分析し、ジェスチャーや移動パターンなどの emergent な非言語コミュニケーションを抽出・理解しています。この研究は、主にMOBAゲームや他のシューターにおける verbal coordination に焦点を当てていた先行研究の gap を埋めるものです。

media TLDR AI · 18日前 · 5 回表示

AnthropicがClaude Opus 5をリリース;NVIDIAがオープンウェイト政策を要請

Anthropicは、Claude Fable 5の能力に迫りながら半分の価格で提供されるより効率的なモデルとしてClaude Opus 5を発表し、Claude Maxのデフォルトモデルとなった。同時に、NVIDIAは革新を促進し、米国が同分野でのリーダーシップを強化するため、オープンウェイトAIモデルをサポートする米政府の政策を提唱している。

lab Hugging Face Blog · 25日前 · 1 回表示

NVIDIAがエッジデバイスでのリアルタイムロボット制御向け4Bパラメータモデル「Cosmos 3 Edge」をリリース

NVIDIAは、メモリ制約のあるエッジシステムでデータセンターレベルのパフォーマンスを提供するために設計された40億パラメータのオープンワールドモデルであるCosmos 3 Edgeをリリースしました。このモデルにより、ロボットやビジョンAIエージェントは周囲の環境を理解し、リアルタイムで推論を行い、NVIDIA Jetsonモジュールなどのデバイス上で直接アクションを生成することが可能になります。

lab Hugging Face Blog · 29日前 · 8 回表示

NVIDIA、RTEBで1位にランクインするNemotron 3 Embedモデルをリリース

NVIDIAは、生産規模のRAG、エージェント型検索、コード検索、エージェントメモリのための検索品質を向上させるために設計された、オープンかつ商用利用可能な埋め込みモデルのコレクションであるNemotron 3 Embedをリリースしました。このコレクションには、RTEBリーダーボードで総合1位を獲得した8Bモデルと、デプロイメント用に最適化された効率的な1Bバリエーションが含まれています。

media MarkTechPost · 3日前 · 1 回表示

NVIDIA、Nemotron 3.5 LightningモデルとNeMo Switchyardルーターをリリース

NVIDIAは、常時稼働するAIエージェントの構築のために設計された2つのオープンソースアーティファクト——Nemotron 3.5 LightningモデルとNeMo Switchyardルーティングライブラリ——をリリースした。これらのツールは、長時間実行されるエージェントワークフローのすべてのステップをフロンティア推論モデルに送信することに伴う高コストとレイテンシーの問題に対し、専門的な実行およびルーティング機能を提供することで対処している。

lab Hugging Face Blog · 4日前 · 8 回表示

NVIDIA Magpie TTSがアラビア語、韓国語、ポルトガル語を追加し品質を向上

NVIDIAはMagpie多言語TTSモデルのアップデートをリリースし、現代標準アラビア語、韓国語、ブラジルポルトガル語の追加により12言語へのサポートを拡大した。今回のリリースでは、更新されたトレーニングデータとアーキテクチャの変更を通じて既存言語の品質も改善されている。

lab NVIDIA Technical Blog · 4日前 · 8 回表示

Meta、ローカルエージェントAI用の30Bオープンウェイトモデル「Muse Glimmer」をリリース

Metaは、ローカルAIエージェントワーク用に設計された120K+のコンテキストウィンドウを持つ30Bのパラメータを持つ密集モデル「Muse Glimmer」をリリースしました。NVIDIAのエッジ、デスクトップ、ワークステーションプラットフォームで実行するように最適化されており、単一のGPUで20Kトークン/秒の処理速度を実現します。

media MarkTechPost · 5日前 · 13 回表示

NVIDIAが約450msのターンテイクを備えたオープンなフルデュプレックス音声対話モデル「NemotronLabs VoiceChat 11B」をリリース

NVIDIAは、リアルタイムのフルデュプレックス会話のために設計されたオープンな11Bパラメータのエンドツーエンド音声対話モデルであるNemotronLabs VoiceChat 11Bをリリースした。ASR、LLM、TTSをチェーンするカスケード型スタックとは異なり、この統合ネットワークはストリーミング音声の理解と生成を同時に実行し、Full-Duplex-Bench 1.0で測定されたスムーズなターンテイクレイテンシ448msを達成した。

media MarkTechPost · 7日前 · 4 回表示

NVIDIAがAIエージェント構築用のオブジェクト指向Pythonフレームワーク「NOOA」をリリース

NVIDIA Labsは、モデル非依存のPythonフレームワークであるNOOA(NVIDIA Object-Oriented Agents)をオープンソース化しました。このフレームワークは、エージェント開発を単一のPythonクラスに集約します。このアプローチは、プロンプトテンプレートやワークフローグラフを含む断片化したワークフローに取って代わり、メソッドをアクションに、フィールドを状態に、docstringsをプロンプトに、型注釈を強制された契約にマッピングします。