Lab · NVIDIA
lab NVIDIA Research · 4 jam lalu · 1 tayangan

HorizonRelight menggunakan self-conditioning termask untuk relighting video jangka panjang yang konsisten

Peneliti mengatasi diskontinuitas temporal dalam relighting video jangka panjang dengan membingkai ulang tugas sebagai terjemahan domain laten bersyarat temporal. Kerangka kerja ini menegakkan kontinuitas antar-chunk dengan menyebarkan latens domain target melintasi batas dan menggunakan self-conditioning domain target termask untuk membuat perilaku ini dapat dipelajari.

lab NVIDIA Research · 4 jam lalu · 2 tayangan

Nvidia menghadirkan FusionRelight untuk pencahayaan ulang potret secara real-time melalui fusi pengetahuan domain hibrida

Peneliti dari Nvidia telah memperkenalkan FusionRelight, sebuah metode untuk pencahayaan ulang potret yang menggabungkan transfer iluminasi yang secara fisik masuk akal dengan pelestarian identitas dan inferensi real-time yang ringkas. Pendekatan ini memanfaatkan Fusi Pengetahuan Domain Hibrida (HDKF), sebuah kerangka pelatihan yang mendistilasi prior fisika, reflektansi, dan realisme dari data sintetis, One-Light-at-a-Time (OLAT), dan di alam liar ke dalam model siswa.

lab NVIDIA Research · 3 hari lalu · 10 tayangan

NVIDIA merilis model dunia generatif waktu nyata OmniDreams untuk simulasi kendaraan otonom

NVIDIA telah memperkenalkan OmniDreams, sebuah model dunia generatif dasar yang dirancang untuk mengatasi hambatan dalam mengevaluasi kebijakan pengemudi otonom di dalam simulasi loop tertutup. Model ini ditengah- dan pasca-pelatihan dari model difusi Cosmos pada 21k jam skenario berkendara, menghasilkan video secara autoregresif berdasarkan kondisi aksi secara waktu nyata.

lab NVIDIA Research · 18 hari lalu · 9 tayangan

NVIDIA memperkenalkan Spatial-IQ, kerangka kerja diagnostik hierarkis untuk penalaran spasial model multimodal

Peneliti di NVIDIA telah memperkenalkan Spatial-IQ, sebuah kerangka kerja diagnostik yang dirancang untuk mengurai kecerdasan spasial dari model bahasa besar multimodal (MLLM). Berbeda dengan benchmark yang ada yang memperlakukan model sebagai kotak hitam, pendekatan ini menguraikan penghitungan objek dalam struktur 3D bertumpuk menjadi sembilan sub-tugas perseptual dan kognitif yang selaras dengan tahap perkembangan manusia.

lab NVIDIA Research · 18 hari lalu · 13 tayangan

Kuantisasi Buku Kode Berkumpul untuk Kompresi Gambar Berbasis Gauss 2D

Para peneliti menyajikan Cluster-Guided Vector Quantization (CGVQ), sebuah metode yang dirancang untuk meningkatkan kinerja laju-distorsi pada kompresi gambar berbasis primitif Gauss. Pendekatan ini mempartisi parameter Gauss menjadi kelompok-kelompok homogen sebelum kuantisasi, mengatasi inefisiensi yang disebabkan oleh penyimpanan sejumlah besar parameter floating-point per primitif.

lab Hugging Face Blog · 25 hari lalu · 1 tayangan

NVIDIA merilis Cosmos 3 Edge, model 4 miliar parameter untuk kontrol robot waktu nyata di perangkat tepi

NVIDIA telah merilis Cosmos 3 Edge, model dunia terbuka 4 miliar parameter yang dirancang untuk memberikan kinerja setara pusat data pada sistem tepi dengan keterbatasan memori. Model ini memungkinkan robot dan agen AI penglihatan memahami lingkungan mereka, bernalar secara waktu nyata, dan menghasilkan tindakan langsung di perangkat seperti modul NVIDIA Jetson.

lab Hugging Face Blog · 29 hari lalu · 8 tayangan

NVIDIA merilis model Embed Nemotron 3 yang menduduki peringkat #1 di RTEB

NVIDIA telah merilis Nemotron 3 Embed, sebuah koleksi model embedding terbuka dan tersedia secara komersial yang dirancang untuk meningkatkan kualitas retrieval untuk RAG skala produksi, retrieval agentic, retrieval kode, dan memori agen. Koleksi ini menampilkan model 8B yang menduduki peringkat #1 secara keseluruhan di papan peringkat RTEB, bersama dengan varian 1B yang dioptimalkan untuk deployment.

media MarkTechPost · 5 hari lalu · 13 tayangan

NVIDIA merilis NemotronLabs VoiceChat 11B, model speech-to-speech full-duplex terbuka dengan pergantian giliran ~450 ms

NVIDIA telah merilis NemotronLabs VoiceChat 11B, model speech-to-speech end-to-end 11B parameter yang terbuka dan dirancang untuk percakapan real-time full-duplex. Tidak seperti tumpukan bertingkat yang merangkai ASR, LLM, dan TTS, jaringan terpadu ini melakukan pemahaman dan generasi suara secara streaming secara bersamaan, mencapai latensi pergantian giliran yang mulus sebesar 448 ms di Full-Duplex-Bench 1.0.

media MarkTechPost · 7 hari lalu · 4 tayangan

NVIDIA merilis NOOA, kerangka kerja Python berorientasi objek untuk membangun agen AI

NVIDIA Labs telah membuka sumber NOOA (NVIDIA Object-Oriented Agents), sebuah kerangka kerja Python yang agnostik terhadap model dan mengonsolidasikan pengembangan agen ke dalam satu kelas Python. Pendekatan ini menggantikan alur kerja terfragmentasi yang melibatkan templat prompt dan grafik alur kerja dengan memetakan metode ke tindakan, bidang ke keadaan, docstring ke prompt, dan anotasi tipe ke kontrak yang ditegakkan.