Sumber · NVIDIA Research
lab NVIDIA Research · 6 hari lalu · 23 tayangan

HorizonRelight menggunakan self-conditioning termask untuk relighting video jangka panjang yang konsisten

Peneliti mengatasi diskontinuitas temporal dalam relighting video jangka panjang dengan membingkai ulang tugas sebagai terjemahan domain laten bersyarat temporal. Kerangka kerja ini menegakkan kontinuitas antar-chunk dengan menyebarkan latens domain target melintasi batas dan menggunakan self-conditioning domain target termask untuk membuat perilaku ini dapat dipelajari.

lab NVIDIA Research · 6 hari lalu · 28 tayangan

Nvidia menghadirkan FusionRelight untuk pencahayaan ulang potret secara real-time melalui fusi pengetahuan domain hibrida

Peneliti dari Nvidia telah memperkenalkan FusionRelight, sebuah metode untuk pencahayaan ulang potret yang menggabungkan transfer iluminasi yang secara fisik masuk akal dengan pelestarian identitas dan inferensi real-time yang ringkas. Pendekatan ini memanfaatkan Fusi Pengetahuan Domain Hibrida (HDKF), sebuah kerangka pelatihan yang mendistilasi prior fisika, reflektansi, dan realisme dari data sintetis, One-Light-at-a-Time (OLAT), dan di alam liar ke dalam model siswa.

lab NVIDIA Research · 9 hari lalu · 61 tayangan

LLM menyamai atau mengalahkan optimisasi Bayesian untuk optimisasi hiperparameter

Sebuah makalah baru mengeksplorasi penggunaan model bahasa besar fundamental (LLM) untuk mengotomatisasi optimisasi hiperparameter (HPO), sebuah proses yang biasanya mengandalkan pendekatan manual dalam pengaturan anggaran terbatas. Para penulis mengembangkan metodologi di mana LLM menyarankan konfigurasi hiperparameter berdasarkan deskripsi dataset dan model, yang kemudian disempurnakan secara iteratif sesuai dengan kinerja model.

lab NVIDIA Research · 9 hari lalu · 56 tayangan

Source memperkenalkan diferensiasi unrolled aproksimasi untuk atribusi data pelatihan

Peneliti memperkenalkan Source, metode atribusi data pelatihan (TDA) baru yang menggabungkan efisiensi komputasi fungsi pengaruh dengan akurasi pendekatan berbasis unrolling. Dengan menggunakan formula mirip fungsi pengaruh untuk mengaproksimasi diferensiasi unrolled, Source mengatasi keterbatasan dalam metode diferensiasi implisit, seperti kegagalan mereka memperhitungkan bias optimisasi atau pipeline multi-tahap.

lab NVIDIA Research · 9 hari lalu · 34 tayangan

NVIDIA merilis model dunia generatif waktu nyata OmniDreams untuk simulasi kendaraan otonom

NVIDIA telah memperkenalkan OmniDreams, sebuah model dunia generatif dasar yang dirancang untuk mengatasi hambatan dalam mengevaluasi kebijakan pengemudi otonom di dalam simulasi loop tertutup. Model ini ditengah- dan pasca-pelatihan dari model difusi Cosmos pada 21k jam skenario berkendara, menghasilkan video secara autoregresif berdasarkan kondisi aksi secara waktu nyata.

lab NVIDIA Research · 10 hari lalu · 36 tayangan

DSTP meredam kegagalan pemangkasan token visual dalam penalaran MLLM yang kompleks

Peneliti mengidentifikasi Pergeseran Informasi Visual Relevan (RVIS) selama dekoding sebagai penyebab utama kegagalan metode pemangkasan token visual yang ada pada Model Bahasa Besar Multimodal (MLLM). Untuk mengatasi hal ini, mereka mengusulkan Pemangkasan Token Sadar Pergeseran Tahap Dekoding (DSTP), sebuah kerangka kerja tanpa pelatihan yang menyelaraskan token visual dengan persyaratan penalaran yang berubah.

lab NVIDIA Research · 10 hari lalu · 28 tayangan

ZPPO menggunakan prompt alih-alih gradien untuk meningkatkan pelatihan model visi-bahasa kecil

Para peneliti memperkenalkan Zone of Proximal Policy Optimization (ZPPO), sebuah metode yang menyuntikkan pengetahuan guru ke dalam prompt daripada gradien kebijakan untuk mengatasi kerapuhan dalam distilasi pengetahuan dan pergeseran dalam pembelajaran penguatan. ZPPO membangun Binary Candidate-included Questions (BCQ) dan Negative Candidate-included Questions (NCQ) untuk pertanyaan sulit, dan memutar ulang pertanyaan tersebut melalui buffer replays hingga akurasi siswa meningkat atau pertanyaan tersebut dihapus.

lab NVIDIA Research · 10 hari lalu · 21 tayangan

Hide to See memperkenalkan masking prefix penalaran untuk distilasi VLM

Peneliti mengusulkan kerangka kerja distilasi pikir-jawab baru yang meningkatkan kemampuan model bahasa-visi kompak untuk memanfaatkan bukti visual dengan melakukan masking pada prefix penalaran yang menonjol. Pendekatan ini mengatasi masalah "pelupakan visual" yang umum terjadi pada jejak pikir-jawab panjang, di mana siswa kehilangan fokus pada petunjuk visual selama penalaran yang diperpanjang.

lab NVIDIA Research · 10 hari lalu · 15 tayangan

SpatialClaw menggunakan kode sebagai antarmuka aksi untuk penalaran spasial agentic

Peneliti mengusulkan SpatialClaw, sebuah framework tanpa pelatihan yang mengadopsi kode sebagai antarmuka aksi untuk meningkatkan penalaran spasial terbuka 3D dan 4D dalam model visi-bahasa. Berbeda dengan agen yang ada yang mengandalkan eksekusi satu-lewat atau panggilan alat yang kaku, SpatialClaw mempertahankan kernel Python stateful yang telah dimuat sebelumnya dengan frame input dan primitif persepsi.

lab NVIDIA Research · 24 hari lalu · 28 tayangan

NVIDIA memperkenalkan Spatial-IQ, kerangka kerja diagnostik hierarkis untuk penalaran spasial model multimodal

Peneliti di NVIDIA telah memperkenalkan Spatial-IQ, sebuah kerangka kerja diagnostik yang dirancang untuk mengurai kecerdasan spasial dari model bahasa besar multimodal (MLLM). Berbeda dengan benchmark yang ada yang memperlakukan model sebagai kotak hitam, pendekatan ini menguraikan penghitungan objek dalam struktur 3D bertumpuk menjadi sembilan sub-tugas perseptual dan kognitif yang selaras dengan tahap perkembangan manusia.

lab NVIDIA Research · 24 hari lalu · 38 tayangan

Kuantisasi Buku Kode Berkumpul untuk Kompresi Gambar Berbasis Gauss 2D

Para peneliti menyajikan Cluster-Guided Vector Quantization (CGVQ), sebuah metode yang dirancang untuk meningkatkan kinerja laju-distorsi pada kompresi gambar berbasis primitif Gauss. Pendekatan ini mempartisi parameter Gauss menjadi kelompok-kelompok homogen sebelum kuantisasi, mengatasi inefisiensi yang disebabkan oleh penyimpanan sejumlah besar parameter floating-point per primitif.