출처 · NVIDIA Research
lab NVIDIA Research · 1일 전 · 조회수 7회

Symphony는 계층적 이종 처리로 희소 및 밀집 텐서를 오케스트레이션합니다

본 논문은 Symphony를 제안합니다. 이는 GPU와 같은 현재 고성능 아키텍처의 메모리 시스템 비효율성을 해결하도록 설계된 하이브리드 프로그래머블 및 전용 아키텍처입니다. 불필요한 데이터 이동과 거리를 줄이기 위해 메모리 계층 전반에 걸쳐 데이터를 오케스트레이션하는 데 중점을 둡니다.

lab NVIDIA Research · 7일 전 · 조회수 25회

HorizonRelight는 일관된 장시간 비디오 리라이트를 위해 마스크된 자기 조건화를 사용합니다

연구원들은 작업을 시간 조건부 잠재 도메인 번역으로 재구성하여 장시간 비디오 리라이트의 시간적 불연속성을 해결합니다. 이 프레임워크는 경계를 통해 대상 도메인 잠재 변수를 전파하여 청크 간 연속성을 강제하고, 마스크된 대상 도메인 자기 조건화를 사용하여 이 동작을 학습 가능하게 만듭니다.

lab NVIDIA Research · 7일 전 · 조회수 28회

Nvidia, 하이브리드 도메인 지식 융합을 통한 실시간 초상화 재조명을 위한 FusionRelight 발표

엔비디아 연구진은 물리적으로 타당한 조명 전달과 정체성 보존, 그리고 컴팩트한 실시간 추론을 결합하는 초상화 재조명 방법인 FusionRelight를 소개했습니다. 이 접근 방식은 합성 데이터, One-Light-at-a-Time (OLAT) 데이터 및 자연 환경(in-the-wild) 데이터에서 물리, 반사율, 현실감 사전 지식을 학생 모델로 증류하는 학습 프레임워크인 하이브리드 도메인 지식 융합(HDKF)을 활용합니다.

lab NVIDIA Research · 9일 전 · 조회수 61회

LLM이 하이퍼파라미터 최적화에서 베이지안 최적화와 동등하거나 이를 능가함

새로운 논문은 제한된 예산 설정에서 일반적으로 수동 접근 방식에 의존하는 프로세스인 하이퍼파라미터 최적화(HPO)를 자동화하기 위해 기초 대규모 언어 모델(LLM)을 사용하는 것을 탐구합니다. 저자들은 데이터셋 및 모델 설명에 기반하여 LLM이 하이퍼파라미터 구성을 제안하고, 이를 모델 성능에 따라 반복적으로 정제하는 방법론을 개발했습니다.

lab NVIDIA Research · 9일 전 · 조회수 56회

Source가 훈련 데이터 속성 추정을 위한 근사 언롤링 미분 도입

연구자들은 영향 함수의 계산 효율성과 언롤링 기반 접근법의 정확성을 결합한 새로운 훈련 데이터 속성 추정(TDA) 방법인 Source를 소개합니다. 영향 함수와 유사한 공식을 사용하여 언롤링 미분을 근사함으로써, Source는 최적화 편향이나 다단계 파이프라인을 고려하지 않는다는 암시적 미분 방법의 한계를 해결합니다.

lab NVIDIA Research · 9일 전 · 조회수 34회

NVIDIA, 자율주행 시뮬레이션을 위한 실시간 생성형 월드 모델 OmniDreams 출시

NVIDIA는 폐쇄 루프 시뮬레이션 내에서 자율 주행 정책의 평가 병목 현상을 해결하기 위해 설계된 파운데이션 생성형 월드 모델인 OmniDreams를 소개했습니다. 21,000시간의 주행 시나리오로 Cosmos 확산 모델을 중기 및 후기 학습한 이 모델은 실시간으로 행동 조건부 동영상을 자기회귀적으로 생성합니다.

lab NVIDIA Research · 9일 전 · 조회수 31회

jlorraine, 딥러닝을 위한 확장 가능한 중첩 최적화 도구 발표

본 기사는 대규모 딥러닝 설정에 이중 수준 또는 중첩 최적화를 적용하는 과제를 다루는 jlorraine 의 논문을 소개합니다. 그래디언트 기반 최적화는 일반적으로 단일 매개변수 집합을 업데이트하지만, 많은 응용 프로그램에서는 서로 중첩된 다른 목적 함수에 대해 매개변수 부분 집합을 업데이트해야 합니다.

lab NVIDIA Research · 10일 전 · 조회수 36회

DSTP가 복잡한 MLLM 추론에서 시각적 토큰 가지치기 실패를 완화합니다

연구자들은 디코딩 중 관련 시각 정보 이동(RVIS)이 멀티모달 대규모 언어 모델(MLLM)에서 기존 시각적 토큰 가지치기 방법의 실패 주원인임을 확인했습니다. 이를 해결하기 위해 그들은 학습이 필요 없는 프레임워크인 Decoding-stage Shift-aware Token Pruning(DSTP)을 제안하며, 이는 시각적 토큰을 변화하는 추론 요구 사항과 정렬시킵니다.

lab NVIDIA Research · 10일 전 · 조회수 26회

GenRecal은 재보정을 통해 대규모 비전-언어 모델을 소규모 모델로 증류합니다

연구자들은 GenRecal을 제시했습니다. 이는 대규모 비전-언어 모델(VLM)에서 더 작고 효율적인 대응 모델로 지식을 전달하는 범용 증류 프레임워크입니다. 이 방법은 서로 다른 모델 유형 간에 특징 표현을 정렬하고 적응시키기 위한 Re-calibrator를 사용하여 이종 VLM 아키텍처의 과제를 해결합니다.

lab NVIDIA Research · 10일 전 · 조회수 28회

ZPPO는 작은 비전-언어 모델 학습을 개선하기 위해 그래디언트 대신 프롬프트를 사용한다

연구자들은 지식 증류의 취약성과 강화학습에서의 드리프트(drift) 문제를 해결하기 위해 정책 그래디언트가 아닌 프롬프트에 교사 지식을 주입하는 방법인 근접 정책 최적화 영역(Zone of Proximal Policy Optimization, ZPPO)을 소개한다. ZPPO는 어려운 질문에 대해 이진 후보 포함 질문(Binary Candidate-included Questions, BCQ)과 부정 후보 포함 질문(Negative Candidate-included Questions, NCQ)을 구성하고, 학생의 정확도가 향상되거나 제외될 때까지 리플레이 버퍼를 통해 이를 순환시킨다.

lab NVIDIA Research · 10일 전 · 조회수 21회

Hide to See는 VLM 증류용 추론 접두사 마스킹을 도입합니다

연구자들은 시각적 증거를 활용하는 컴팩트한 비전-라ngu아지 모델의 능력을 향상시키는 새로운 생각-답변 증류 프레임워크를 제안했습니다. 이는 중요한 추론 접두사를 마스킹하여 달성됩니다. 이 접근 방식은 긴 생각-답변 추적에서 일반적으로 발생하는 "시각적 망각" 문제를 해결합니다. 학생들은 확장된 추론 동안 시각적 단서에 대한 집중력을 잃습니다.

lab NVIDIA Research · 10일 전 · 조회수 15회

SpatialClaw는 에이전트 공간 추론을 위해 코드를 액션 인터페이스로 사용

연구자들은 SpatialClaw를 제안했습니다. 이는 훈련 없는 프레임워크로, 비전-언어 모델에서 오픈 엔디드 3D 및 4D 공간 추론을 개선하기 위해 액션 인터페이스로 코드를 채택합니다. 기존 에이전트들이 단일 패스 실행이나 경직된 도구 호출에 의존하는 것과 달리, SpatialClaw는 입력 프레임과 지각 프리미티브가 사전 로드된 상태 유지 Python 커널을 유지합니다.

lab NVIDIA Research · 24일 전 · 조회수 28회

NVIDIA는 다중 모달 모델의 공간 추론을 위한 계층적 진단 프레임워크인 Spatial-IQ를 출시했다

NVIDIA 연구진은 다중 모달 대규모 언어 모델(MLLMs)의 공간 지능을 해체하기 위해 설계된 진단 프레임워크인 Spatial-IQ를 출시했습니다. 모델을 블랙 박스로 취급하는 기존 벤치마크와 달리, 이 접근 방식은 쌓여 있는 3D 구조에서의 객체 카운팅을 인간 발달 단계와 일치하는 아홉 가지 지각 및 인지 하위 작업으로 분해합니다.

lab NVIDIA Research · 24일 전 · 조회수 38회

2D 가우시안 기반 이미지 압축을 위한 클러스터화된 코드북 양자화

연구자들은 가우시안 프리미티브 기반 이미지 압축의 레이트-왜곡 성능을 개선하도록 설계된 Cluster-Guided Vector Quantization (CGVQ)를 제시합니다. 이 접근 방식은 양자화 전에 가우시안 매개변수를 동질적인 그룹으로 분할하여 프리미티브당 많은 부동 소수점 매개변수를 저장함으로써 발생하는 비효율성을 해결합니다.