Symphony는 계층적 이종 처리로 희소 및 밀집 텐서를 오케스트레이션합니다
본 논문은 Symphony를 제안합니다. 이는 GPU와 같은 현재 고성능 아키텍처의 메모리 시스템 비효율성을 해결하도록 설계된 하이브리드 프로그래머블 및 전용 아키텍처입니다. 불필요한 데이터 이동과 거리를 줄이기 위해 메모리 계층 전반에 걸쳐 데이터를 오케스트레이션하는 데 중점을 둡니다.
본 논문은 Symphony를 제안합니다. 이는 GPU와 같은 현재 고성능 아키텍처의 메모리 시스템 비효율성을 해결하도록 설계된 하이브리드 프로그래머블 및 전용 아키텍처입니다. 불필요한 데이터 이동과 거리를 줄이기 위해 메모리 계층 전반에 걸쳐 데이터를 오케스트레이션하는 데 중점을 둡니다.
연구원들은 작업을 시간 조건부 잠재 도메인 번역으로 재구성하여 장시간 비디오 리라이트의 시간적 불연속성을 해결합니다. 이 프레임워크는 경계를 통해 대상 도메인 잠재 변수를 전파하여 청크 간 연속성을 강제하고, 마스크된 대상 도메인 자기 조건화를 사용하여 이 동작을 학습 가능하게 만듭니다.
엔비디아 연구진은 물리적으로 타당한 조명 전달과 정체성 보존, 그리고 컴팩트한 실시간 추론을 결합하는 초상화 재조명 방법인 FusionRelight를 소개했습니다. 이 접근 방식은 합성 데이터, One-Light-at-a-Time (OLAT) 데이터 및 자연 환경(in-the-wild) 데이터에서 물리, 반사율, 현실감 사전 지식을 학생 모델로 증류하는 학습 프레임워크인 하이브리드 도메인 지식 융합(HDKF)을 활용합니다.
새로운 논문은 제한된 예산 설정에서 일반적으로 수동 접근 방식에 의존하는 프로세스인 하이퍼파라미터 최적화(HPO)를 자동화하기 위해 기초 대규모 언어 모델(LLM)을 사용하는 것을 탐구합니다. 저자들은 데이터셋 및 모델 설명에 기반하여 LLM이 하이퍼파라미터 구성을 제안하고, 이를 모델 성능에 따라 반복적으로 정제하는 방법론을 개발했습니다.
연구자들은 영향 함수의 계산 효율성과 언롤링 기반 접근법의 정확성을 결합한 새로운 훈련 데이터 속성 추정(TDA) 방법인 Source를 소개합니다. 영향 함수와 유사한 공식을 사용하여 언롤링 미분을 근사함으로써, Source는 최적화 편향이나 다단계 파이프라인을 고려하지 않는다는 암시적 미분 방법의 한계를 해결합니다.
NVIDIA는 폐쇄 루프 시뮬레이션 내에서 자율 주행 정책의 평가 병목 현상을 해결하기 위해 설계된 파운데이션 생성형 월드 모델인 OmniDreams를 소개했습니다. 21,000시간의 주행 시나리오로 Cosmos 확산 모델을 중기 및 후기 학습한 이 모델은 실시간으로 행동 조건부 동영상을 자기회귀적으로 생성합니다.
이 논문은 JacNet을 소개합니다. JacNet은 매핑 자체 대신 입력-출력 함수의 야코비안을 직접 학습하는 신경망 아키텍처입니다. 이 접근 방식은 미분 특성에 대한 정밀한 제어를 가능하게 하여 가역성 및 k-Lipschitz 연속성과 같은 구조적 사전 지식을 강제할 수 있습니다.
본 기사는 대규모 딥러닝 설정에 이중 수준 또는 중첩 최적화를 적용하는 과제를 다루는 jlorraine 의 논문을 소개합니다. 그래디언트 기반 최적화는 일반적으로 단일 매개변수 집합을 업데이트하지만, 많은 응용 프로그램에서는 서로 중첩된 다른 목적 함수에 대해 매개변수 부분 집합을 업데이트해야 합니다.
연구원들은 에지 배포에 적합한 컴팩트한 버전으로 대규모 비전-언어 모델을 증류하기 위한 마스크 점진적 강화 학습 프레임워크인 Masters를 제안합니다. 이 방법은 교사 및 학생 모델 간의 크기 차이로 인한 불안정성을 해결합니다.
연구자들은 디코딩 중 관련 시각 정보 이동(RVIS)이 멀티모달 대규모 언어 모델(MLLM)에서 기존 시각적 토큰 가지치기 방법의 실패 주원인임을 확인했습니다. 이를 해결하기 위해 그들은 학습이 필요 없는 프레임워크인 Decoding-stage Shift-aware Token Pruning(DSTP)을 제안하며, 이는 시각적 토큰을 변화하는 추론 요구 사항과 정렬시킵니다.
연구자들은 GenRecal을 제시했습니다. 이는 대규모 비전-언어 모델(VLM)에서 더 작고 효율적인 대응 모델로 지식을 전달하는 범용 증류 프레임워크입니다. 이 방법은 서로 다른 모델 유형 간에 특징 표현을 정렬하고 적응시키기 위한 Re-calibrator를 사용하여 이종 VLM 아키텍처의 과제를 해결합니다.
연구자들은 지식 증류의 취약성과 강화학습에서의 드리프트(drift) 문제를 해결하기 위해 정책 그래디언트가 아닌 프롬프트에 교사 지식을 주입하는 방법인 근접 정책 최적화 영역(Zone of Proximal Policy Optimization, ZPPO)을 소개한다. ZPPO는 어려운 질문에 대해 이진 후보 포함 질문(Binary Candidate-included Questions, BCQ)과 부정 후보 포함 질문(Negative Candidate-included Questions, NCQ)을 구성하고, 학생의 정확도가 향상되거나 제외될 때까지 리플레이 버퍼를 통해 이를 순환시킨다.
연구자들은 시각적 증거를 활용하는 컴팩트한 비전-라ngu아지 모델의 능력을 향상시키는 새로운 생각-답변 증류 프레임워크를 제안했습니다. 이는 중요한 추론 접두사를 마스킹하여 달성됩니다. 이 접근 방식은 긴 생각-답변 추적에서 일반적으로 발생하는 "시각적 망각" 문제를 해결합니다. 학생들은 확장된 추론 동안 시각적 단서에 대한 집중력을 잃습니다.
연구자들은 SpatialClaw를 제안했습니다. 이는 훈련 없는 프레임워크로, 비전-언어 모델에서 오픈 엔디드 3D 및 4D 공간 추론을 개선하기 위해 액션 인터페이스로 코드를 채택합니다. 기존 에이전트들이 단일 패스 실행이나 경직된 도구 호출에 의존하는 것과 달리, SpatialClaw는 입력 프레임과 지각 프리미티브가 사전 로드된 상태 유지 Python 커널을 유지합니다.
연구자들은 외부 도구가 필요한 비전-언어 모델의 "사고-행동 간극"을 해결하기 위해 에이전트 탐색 정책 최적화(AXPO)를 제안합니다. 이 간극으로 인해 GRPO와 같은 표준 RL 방법은 롤아웃의 약 30%에서만 도구 사용을 시도하며, 높은 실패율이 학습 신호를 억제합니다.
연구자들은 로봇 공장을 위해 설계된 ROSA라는 로봇 파운데이션 모델 서빙 시스템을 제안하며, 이는 단일 로봇 및 엣지 컴퓨팅 가정에서 벗어나는 것을 목표로 합니다. 이 시스템은 네트워크를 통해 로봇 군집이 서버급 GPU에 접근할 수 있도록 공유 GPU 풀 서빙을 활용합니다.
NVIDIA 연구진은 다중 모달 대규모 언어 모델(MLLMs)의 공간 지능을 해체하기 위해 설계된 진단 프레임워크인 Spatial-IQ를 출시했습니다. 모델을 블랙 박스로 취급하는 기존 벤치마크와 달리, 이 접근 방식은 쌓여 있는 3D 구조에서의 객체 카운팅을 인간 발달 단계와 일치하는 아홉 가지 지각 및 인지 하위 작업으로 분해합니다.
연구자들은 가우시안 프리미티브 기반 이미지 압축의 레이트-왜곡 성능을 개선하도록 설계된 Cluster-Guided Vector Quantization (CGVQ)를 제시합니다. 이 접근 방식은 양자화 전에 가우시안 매개변수를 동질적인 그룹으로 분할하여 프리미티브당 많은 부동 소수점 매개변수를 저장함으로써 발생하는 비효율성을 해결합니다.
연구자들은 경쟁 슈팅 게임 Delta Force의 게임플레이 비디오를 분석하여 제스처와 이동 패턴과 같은emergent한 비언어적 의사소통을 추출하고 이해합니다. 이 작업은 주로 MOBA 게임이나 다른 슈터 게임에서의 언어적 협조에 초점을 맞춘 기존 연구의 gap을 해결합니다.
NVIDIA의 연구원들은 경쟁적인 그룹 플레이 일정 조정 및 실험실 환경 재현의 어려움을 해결하기 위해 현장 실험 방법론을 채택하고 있습니다. 이 접근 방식은 실험을 토너먼트 구조에 직접 통합하여 하이브리드 토너먼트-실험을 생성합니다.