Symphonyは階層型異種処理で疎および密テンソルをオーケストレーション
本記事では、Symphonyを提案しています。これは、GPUなどの現在の高性能アーキテクチャにおけるメモリシステムの非効率に対処するために設計された、ハイブリッドなプログラム可能かつ専用アーキテクチャです。不要なデータ移動と距離を削減するため、メモリ階層全体でデータをオーケストレーションすることに焦点を当てています。
本記事では、Symphonyを提案しています。これは、GPUなどの現在の高性能アーキテクチャにおけるメモリシステムの非効率に対処するために設計された、ハイブリッドなプログラム可能かつ専用アーキテクチャです。不要なデータ移動と距離を削減するため、メモリ階層全体でデータをオーケストレーションすることに焦点を当てています。
研究者たちは、タスクを時間条件付き潜在ドメイン変換として再構成することで、長時間のビデオリライティングにおける時間的不連続性に対処します。このフレームワークは、ターゲットドメインの潜在変数を境界間で伝播させることでチャンク間の連続性を強制し、マスクされたターゲットドメイン自己条件付けを使用して、この挙動を学習可能にします。
Nvidiaの研究者らは、物理的に妥当な照明転送とアイデンティティの保持、コンパクトなリアルタイム推論を組み合わせるポートレート再照明手法であるFusionRelightを導入した。このアプローチは、合成データ、One-Light-at-a-Time (OLAT)、および野外データから物理学、反射率、リアリティの事前知識を学生モデルに蒸留するトレーニングフレームワークであるハイブリッドドメイン知識融合(HDKF)を利用している。
新しい論文では、基礎的な大規模言語モデル(LLM)を使用してハイパーパラメータ最適化(HPO)を自動化することが探られています。このプロセスは通常、限られた予算の状況で手動のアプローチに依存します。著者たちは、LLMがデータセットとモデルの説明に基づいてハイパーパラメータ構成を提案し、それらがモデルのパフォーマンスに応じて反復的に改善される方法論を開発しました。
研究者は、影響関数の計算効率と展開ベースのアプローチの精度を組み合わせた新しいトレーニングデータ属性付け(TDA)手法であるSourceを紹介する。影響関数に似た公式を使用して展開微分を近似することにより、Sourceは最適化バイアスやマルチステージパイプラインを考慮しないという暗黙的微分手法の制限に対処する。
NVIDIAは、クローズドループシミュレーションにおける自動運転ポリシーの評価におけるボトルネックに対処するために設計された基盤生成型世界モデル「OmniDreams」を発表した。Cosmos拡散モデルを21,000時間の運転シナリオでミッドトレーニングおよびポストトレーニングし、リアルタイムでアクション条件付きの動画を自己回帰的に生成する。
本論文では、JacNetというニューラルネットワークアーキテクチャを紹介しています。これは関数そのものではなく、入力-出力関数のヤコビアンを直接学習します。このアプローチにより、微分の性質を精密に制御でき、可逆性やk-Lipschitz連続性などの構造的な事前知識を適用することが可能になります。
本記事では、大規模なディープラーニング設定にバイレベルまたはネスト最適化を適用する課題に対処する jlorraine の論文を紹介しています。勾配ベースの最適化は通常、単一のパラメータセットを更新しますが、多くのアプリケーションでは、互いにネストされた異なる目的関数に対してパラメータの部分集合を更新する必要があります。
研究者らは、エッジデプロイメントに適したコンパクトなバージョンに大規模ビジョン言語モデルを蒸留するためのマスクプログレッシブ強化学習フレームワークであるMastersを提案する。この手法は、教師と学生のモデル間のサイズギャップによって引き起こされる不安定性に対処する。
研究者らは、マルチモーダル大規模言語モデル(MLLM)における既存の視覚トークンプルーニング手法の失敗の主な原因として、デコーディング中の関連視覚情報シフト(RVIS)を特定しました。これに対処するため、彼らはトレーニング不要のフレームワークであるDecoding-stage Shift-aware Token Pruning(DSTP)を提案し、視覚トークンを変化していく推論要件と整合させます。
研究者らは、GenRecalを発表しました。これは大規模ビジョン・言語モデル(VLM)からより小さく効率的な対応モデルへ知識を転送する汎用蒸留フレームワークです。本手法は、異なるモデルタイプ間で特徴表現を整列・適応させるためのRe-calibratorを使用し、異種VLMアーキテクチャの課題に対処します。
研究者らは、知識蒸留における脆弱性や強化学習におけるドリフトに対処するため、教師の知識をポリシー勾配ではなくプロンプトに注入する方法であるZone of Proximal Policy Optimization (ZPPO) を導入した。ZPPOは、難しい問題に対してBinary Candidate-included Questions (BCQ) とNegative Candidate-included Questions (NCQ) を構築し、学生の精度が向上するか、除外されるまでリプレイバッファを介してそれらを再循環させる。
研究者は、顕著な推論接頭辞をマスクすることで、コンパクトな視覚言語モデルの視覚証拠の利用能力を向上させる新しい思考-回答蒸留フレームワークを提案しました。このアプローチは、長い思考-回答トレースで一般的に見られる「視覚的忘却」の問題に対処します。これは、学生が拡張された推論中に視覚的な手がかりへの焦点を失う現象です。
研究者らは、SpatialClawを提案しました。これはトレーニング不要のフレームワークで、ビジョン・ランゲージモデルにおけるオープンエンドな3Dおよび4D空間推論を改善するために、アクションインターフェースとしてコードを採用しています。既存のエージェントが単一パス実行や硬直したツール呼び出しに依存するのとは異なり、SpatialClawは入力フレームと知覚プリミティブが事前に読み込まれたステートフルなPythonカーネルを維持します。
研究者たちは、外部ツールを必要とするビジョン・言語モデルにおける「思考と行動のギャップ」に対処するため、Agent Explorative Policy Optimization (AXPO) を提案している。このギャップにより、GRPO などの標準的な RL 手法ではロールアウトの約30%でしかツール使用が試みられず、高い失敗率が学習信号を抑制してしまう。
研究者らは、ロボット工場で使用されることを目的としたロボティクス基盤モデルのサービングシステム「ROSA」を提案した。これは単一ロボットやエッジコンピューティングの前提を超えたものである。本システムは共有GPUプールサービングを活用し、ロボット群がネットワーク経由でサーバークラスのGPUにアクセスできるようにする。
NVIDIAの研究チームは、マルチモーダル大規模言語モデル(MLLMs)の空間知能を分解するために設計された診断フレームワークであるSpatial-IQを発表しました。既存のベンチマークがモデルをブラックボックスとして扱うのとは異なり、このアプローチは、積み重ねられた3D構造における物体数え上げを、人間の発達段階と一致する9つの知覚・認知サブタスクに分解します。
研究者らは、ガウスプリミティブベースの画像圧縮におけるレート歪み性能を向上させるために設計されたCluster-Guided Vector Quantization (CGVQ)を発表します。このアプローチは、量子化の前にガウスパラメータを均質なグループに分割し、各プリミティブあたりの大量の浮動小数点パラメータの保存による非効率性を解決します。
研究者は競技シューティングゲーム『Delta Force』のゲームプレイ動画を分析し、ジェスチャーや移動パターンなどの emergent な非言語コミュニケーションを抽出・理解しています。この研究は、主にMOBAゲームや他のシューターにおける verbal coordination に焦点を当てていた先行研究の gap を埋めるものです。
NVIDIAの研究者たちは、競争的なグループプレイのスケジュール調整やラボ環境の再現の難しさを解決するため、フィールド実験の方法論を採用しています。このアプローチは実験を大会構造に直接統合し、ハイブリッドな大会-実験を作成します。