ソース · NVIDIA Research
lab NVIDIA Research · 17時間前 · 7 回表示

Symphonyは階層型異種処理で疎および密テンソルをオーケストレーション

本記事では、Symphonyを提案しています。これは、GPUなどの現在の高性能アーキテクチャにおけるメモリシステムの非効率に対処するために設計された、ハイブリッドなプログラム可能かつ専用アーキテクチャです。不要なデータ移動と距離を削減するため、メモリ階層全体でデータをオーケストレーションすることに焦点を当てています。

lab NVIDIA Research · 6日前 · 23 回表示

HorizonRelightはマスクされた自己条件付けを使用して、長時間のビデオリライティングの一貫性を達成

研究者たちは、タスクを時間条件付き潜在ドメイン変換として再構成することで、長時間のビデオリライティングにおける時間的不連続性に対処します。このフレームワークは、ターゲットドメインの潜在変数を境界間で伝播させることでチャンク間の連続性を強制し、マスクされたターゲットドメイン自己条件付けを使用して、この挙動を学習可能にします。

lab NVIDIA Research · 6日前 · 28 回表示

Nvidia、ハイブリッドドメイン知識融合によるリアルタイムポートレート再照明手法「FusionRelight」を発表

Nvidiaの研究者らは、物理的に妥当な照明転送とアイデンティティの保持、コンパクトなリアルタイム推論を組み合わせるポートレート再照明手法であるFusionRelightを導入した。このアプローチは、合成データ、One-Light-at-a-Time (OLAT)、および野外データから物理学、反射率、リアリティの事前知識を学生モデルに蒸留するトレーニングフレームワークであるハイブリッドドメイン知識融合(HDKF)を利用している。

lab NVIDIA Research · 9日前 · 61 回表示

LLMはハイパーパラメータ最適化においてベイズ最適化と同等かそれを超える

新しい論文では、基礎的な大規模言語モデル(LLM)を使用してハイパーパラメータ最適化(HPO)を自動化することが探られています。このプロセスは通常、限られた予算の状況で手動のアプローチに依存します。著者たちは、LLMがデータセットとモデルの説明に基づいてハイパーパラメータ構成を提案し、それらがモデルのパフォーマンスに応じて反復的に改善される方法論を開発しました。

lab NVIDIA Research · 9日前 · 56 回表示

Sourceがトレーニングデータ属性付けのための近似アンロール微分を導入

研究者は、影響関数の計算効率と展開ベースのアプローチの精度を組み合わせた新しいトレーニングデータ属性付け(TDA)手法であるSourceを紹介する。影響関数に似た公式を使用して展開微分を近似することにより、Sourceは最適化バイアスやマルチステージパイプラインを考慮しないという暗黙的微分手法の制限に対処する。

lab NVIDIA Research · 9日前 · 34 回表示

NVIDIAが自動運転シミュレーション向けリアルタイム生成型世界モデル「OmniDreams」をリリース

NVIDIAは、クローズドループシミュレーションにおける自動運転ポリシーの評価におけるボトルネックに対処するために設計された基盤生成型世界モデル「OmniDreams」を発表した。Cosmos拡散モデルを21,000時間の運転シナリオでミッドトレーニングおよびポストトレーニングし、リアルタイムでアクション条件付きの動画を自己回帰的に生成する。

lab NVIDIA Research · 9日前 · 25 回表示

JacNetは構造化ヤコビアンを直接モデル化することで関数を学習する

本論文では、JacNetというニューラルネットワークアーキテクチャを紹介しています。これは関数そのものではなく、入力-出力関数のヤコビアンを直接学習します。このアプローチにより、微分の性質を精密に制御でき、可逆性やk-Lipschitz連続性などの構造的な事前知識を適用することが可能になります。

lab NVIDIA Research · 9日前 · 31 回表示

jlorraine がディープラーニング用のスケーラブルなネスト最適化ツールを発表

本記事では、大規模なディープラーニング設定にバイレベルまたはネスト最適化を適用する課題に対処する jlorraine の論文を紹介しています。勾配ベースの最適化は通常、単一のパラメータセットを更新しますが、多くのアプリケーションでは、互いにネストされた異なる目的関数に対してパラメータの部分集合を更新する必要があります。

lab NVIDIA Research · 10日前 · 30 回表示

Mastersはマスキング教師と強化学生によりビジョン言語モデルを蒸留する

研究者らは、エッジデプロイメントに適したコンパクトなバージョンに大規模ビジョン言語モデルを蒸留するためのマスクプログレッシブ強化学習フレームワークであるMastersを提案する。この手法は、教師と学生のモデル間のサイズギャップによって引き起こされる不安定性に対処する。

lab NVIDIA Research · 10日前 · 36 回表示

DSTPが複雑なMLLM推論における視覚トークンプルーニングの失敗を緩和

研究者らは、マルチモーダル大規模言語モデル(MLLM)における既存の視覚トークンプルーニング手法の失敗の主な原因として、デコーディング中の関連視覚情報シフト(RVIS)を特定しました。これに対処するため、彼らはトレーニング不要のフレームワークであるDecoding-stage Shift-aware Token Pruning(DSTP)を提案し、視覚トークンを変化していく推論要件と整合させます。

lab NVIDIA Research · 10日前 · 26 回表示

GenRecalは再較正により大規模ビジョン・言語モデルを小規模モデルに蒸留する

研究者らは、GenRecalを発表しました。これは大規模ビジョン・言語モデル(VLM)からより小さく効率的な対応モデルへ知識を転送する汎用蒸留フレームワークです。本手法は、異なるモデルタイプ間で特徴表現を整列・適応させるためのRe-calibratorを使用し、異種VLMアーキテクチャの課題に対処します。

lab NVIDIA Research · 10日前 · 28 回表示

ZPPOは勾配の代わりにプロンプトを使用して、小規模なビジョン言語モデルのトレーニングを改善する

研究者らは、知識蒸留における脆弱性や強化学習におけるドリフトに対処するため、教師の知識をポリシー勾配ではなくプロンプトに注入する方法であるZone of Proximal Policy Optimization (ZPPO) を導入した。ZPPOは、難しい問題に対してBinary Candidate-included Questions (BCQ) とNegative Candidate-included Questions (NCQ) を構築し、学生の精度が向上するか、除外されるまでリプレイバッファを介してそれらを再循環させる。

lab NVIDIA Research · 10日前 · 21 回表示

Hide to See は VLM 蒸留のための推論接頭辞マスキングを導入

研究者は、顕著な推論接頭辞をマスクすることで、コンパクトな視覚言語モデルの視覚証拠の利用能力を向上させる新しい思考-回答蒸留フレームワークを提案しました。このアプローチは、長い思考-回答トレースで一般的に見られる「視覚的忘却」の問題に対処します。これは、学生が拡張された推論中に視覚的な手がかりへの焦点を失う現象です。

lab NVIDIA Research · 10日前 · 15 回表示

SpatialClawはエージェント空間推論のためのアクションインターフェースとしてコードを使用

研究者らは、SpatialClawを提案しました。これはトレーニング不要のフレームワークで、ビジョン・ランゲージモデルにおけるオープンエンドな3Dおよび4D空間推論を改善するために、アクションインターフェースとしてコードを採用しています。既存のエージェントが単一パス実行や硬直したツール呼び出しに依存するのとは異なり、SpatialClawは入力フレームと知覚プリミティブが事前に読み込まれたステートフルなPythonカーネルを維持します。

lab NVIDIA Research · 10日前 · 27 回表示

AXPO、思考と行動のギャップを修正することでマルチモーダルエージェント推論を改善

研究者たちは、外部ツールを必要とするビジョン・言語モデルにおける「思考と行動のギャップ」に対処するため、Agent Explorative Policy Optimization (AXPO) を提案している。このギャップにより、GRPO などの標準的な RL 手法ではロールアウトの約30%でしかツール使用が試みられず、高い失敗率が学習信号を抑制してしまう。

lab NVIDIA Research · 15日前 · 36 回表示

ROSAが共有GPUプールサービングにより工場生産性を最大12.06倍向上

研究者らは、ロボット工場で使用されることを目的としたロボティクス基盤モデルのサービングシステム「ROSA」を提案した。これは単一ロボットやエッジコンピューティングの前提を超えたものである。本システムは共有GPUプールサービングを活用し、ロボット群がネットワーク経由でサーバークラスのGPUにアクセスできるようにする。

lab NVIDIA Research · 24日前 · 28 回表示

NVIDIA、マルチモーダルモデルの空間推論のための階層的診断フレームワーク「Spatial-IQ」を発表

NVIDIAの研究チームは、マルチモーダル大規模言語モデル(MLLMs)の空間知能を分解するために設計された診断フレームワークであるSpatial-IQを発表しました。既存のベンチマークがモデルをブラックボックスとして扱うのとは異なり、このアプローチは、積み重ねられた3D構造における物体数え上げを、人間の発達段階と一致する9つの知覚・認知サブタスクに分解します。

lab NVIDIA Research · 24日前 · 38 回表示

2Dガウスベース画像圧縮のためのクラスター化コードブック量子化

研究者らは、ガウスプリミティブベースの画像圧縮におけるレート歪み性能を向上させるために設計されたCluster-Guided Vector Quantization (CGVQ)を発表します。このアプローチは、量子化の前にガウスパラメータを均質なグループに分割し、各プリミティブあたりの大量の浮動小数点パラメータの保存による非効率性を解決します。

lab NVIDIA Research · 24日前 · 25 回表示

Delta Forceにおける非言語コミュニケーションのマルチモーダルAI分析

研究者は競技シューティングゲーム『Delta Force』のゲームプレイ動画を分析し、ジェスチャーや移動パターンなどの emergent な非言語コミュニケーションを抽出・理解しています。この研究は、主にMOBAゲームや他のシューターにおける verbal coordination に焦点を当てていた先行研究の gap を埋めるものです。