연구소 · NVIDIA
lab NVIDIA Research · 7시간 전 · 조회수 3회

HorizonRelight는 일관된 장시간 비디오 리라이트를 위해 마스크된 자기 조건화를 사용합니다

연구원들은 작업을 시간 조건부 잠재 도메인 번역으로 재구성하여 장시간 비디오 리라이트의 시간적 불연속성을 해결합니다. 이 프레임워크는 경계를 통해 대상 도메인 잠재 변수를 전파하여 청크 간 연속성을 강제하고, 마스크된 대상 도메인 자기 조건화를 사용하여 이 동작을 학습 가능하게 만듭니다.

lab NVIDIA Research · 7시간 전 · 조회수 2회

Nvidia, 하이브리드 도메인 지식 융합을 통한 실시간 초상화 재조명을 위한 FusionRelight 발표

엔비디아 연구진은 물리적으로 타당한 조명 전달과 정체성 보존, 그리고 컴팩트한 실시간 추론을 결합하는 초상화 재조명 방법인 FusionRelight를 소개했습니다. 이 접근 방식은 합성 데이터, One-Light-at-a-Time (OLAT) 데이터 및 자연 환경(in-the-wild) 데이터에서 물리, 반사율, 현실감 사전 지식을 학생 모델로 증류하는 학습 프레임워크인 하이브리드 도메인 지식 융합(HDKF)을 활용합니다.

lab NVIDIA Research · 3일 전 · 조회수 10회

NVIDIA, 자율주행 시뮬레이션을 위한 실시간 생성형 월드 모델 OmniDreams 출시

NVIDIA는 폐쇄 루프 시뮬레이션 내에서 자율 주행 정책의 평가 병목 현상을 해결하기 위해 설계된 파운데이션 생성형 월드 모델인 OmniDreams를 소개했습니다. 21,000시간의 주행 시나리오로 Cosmos 확산 모델을 중기 및 후기 학습한 이 모델은 실시간으로 행동 조건부 동영상을 자기회귀적으로 생성합니다.

lab NVIDIA Research · 18일 전 · 조회수 9회

NVIDIA는 다중 모달 모델의 공간 추론을 위한 계층적 진단 프레임워크인 Spatial-IQ를 출시했다

NVIDIA 연구진은 다중 모달 대규모 언어 모델(MLLMs)의 공간 지능을 해체하기 위해 설계된 진단 프레임워크인 Spatial-IQ를 출시했습니다. 모델을 블랙 박스로 취급하는 기존 벤치마크와 달리, 이 접근 방식은 쌓여 있는 3D 구조에서의 객체 카운팅을 인간 발달 단계와 일치하는 아홉 가지 지각 및 인지 하위 작업으로 분해합니다.

lab NVIDIA Research · 18일 전 · 조회수 13회

2D 가우시안 기반 이미지 압축을 위한 클러스터화된 코드북 양자화

연구자들은 가우시안 프리미티브 기반 이미지 압축의 레이트-왜곡 성능을 개선하도록 설계된 Cluster-Guided Vector Quantization (CGVQ)를 제시합니다. 이 접근 방식은 양자화 전에 가우시안 매개변수를 동질적인 그룹으로 분할하여 프리미티브당 많은 부동 소수점 매개변수를 저장함으로써 발생하는 비효율성을 해결합니다.

media TLDR AI · 18일 전 · 조회수 5회

Anthropic, Claude Opus 5 출시; NVIDIA, 오픈 가중치 정책 촉구

Anthropic은 Claude Fable 5의 성능에 근접하면서도 가격이 절반인 더 효율적인 모델인 Claude Opus 5를 출시했으며, 이는 Claude Max의 기본 모델이 되었습니다. 동시에 NVIDIA는 혁신을 장려하고 미국이 해당 부문에서 주도권을 강화할 수 있도록 오픈 가중치 AI 모델을 지원하는 미국 정부 정책을 촉구하고 있습니다.

lab Hugging Face Blog · 25일 전 · 조회수 1회

NVIDIA가 엣지 디바이스에서의 실시간 로봇 제어를 위한 4B 파라미터 모델인 Cosmos 3 Edge를 출시

NVIDIA는 메모리가 제한된 엣지 시스템에서 데이터 센터 수준의 성능을 제공하도록 설계된 40억 파라미터의 오픈 월드 모델인 Cosmos 3 Edge를 출시했습니다. 이 모델은 로봇과 비전 AI 에이전트가 주변 환경을 이해하고, 실시간으로 추론하며, NVIDIA Jetson 모듈과 같은 디바이스에서 직접 행동을 생성할 수 있게 합니다.

lab Hugging Face Blog · 29일 전 · 조회수 8회

NVIDIA, RTEB에서 1위에 랭크된 Nemotron 3 Embed 모델 출시

NVIDIA는 생산 규모의 RAG, 에이전트 검색, 코드 검색 및 에이전트 메모리를 위한 검색 품질을 개선하도록 설계된 오픈 및 상용 임베딩 모델 컬렉션인 Nemotron 3 Embed를 출시했습니다. 이 컬렉션에는 RTEB 리더보드에서 종합 1위를 차지한 8B 모델과 배포를 위해 최적화된 효율적인 1B 변형이 포함되어 있습니다.

media MarkTechPost · 3일 전 · 조회수 1회

NVIDIA가 Nemotron 3.5 Lightning 모델과 NeMo Switchyard 라우터를 출시하다

NVIDIA는 항상 켜져 있는 AI 에이전트를 구축하기 위해 설계된 두 가지 오픈소스 아티팩트인 Nemotron 3.5 Lightning 모델과 NeMo Switchyard 라우팅 라이브러리를 출시했습니다. 이 도구들은 긴 실행 중인 에이전트 워크플로우의 모든 단계를 최첨단 추론 모델로 전송하는 데 따른 높은 비용과 지연 시간을 전문화된 실행 및 라우팅 기능을 제공하여 해결합니다.

media MarkTechPost · 5일 전 · 조회수 13회

NVIDIA, ~450ms 턴테이킹을 지원하는 오픈 풀듀플렉스 음성-음성 모델 NemotronLabs VoiceChat 11B 출시

NVIDIA는 실시간 풀듀플렉스 대화를 위해 설계된 오픈 11B 파라미터 엔드투엔드 음성-음성 모델인 NemotronLabs VoiceChat 11B를 출시했습니다. ASR, LLM 및 TTS를 체이닝하는 캐스케이디드 스택과 달리, 이 통합 네트워크는 스트리밍 음성을 동시에 이해하고 생성하며, Full-Duplex-Bench 1.0에서 측정된 부드러운 턴테이킹 지연시간은 448ms입니다.

media MarkTechPost · 7일 전 · 조회수 5회

NVIDIA가 AI 에이전트 구축을 위한 객체 지향 Python 프레임워크인 NOOA를 출시

NVIDIA Labs는 모델 비종속성(model-agnostic) Python 프레임워크인 NOOA(NVIDIA Object-Oriented Agents)를 오픈소스로 공개했으며, 이는 에이전트 개발을 단일 Python 클래스로 통합합니다. 이 접근 방식은 메서드를 액션에, 필드를 상태에, docstrings를 프롬프트에, 타입 어노테이션을 강제 계약에 매핑함으로써 프롬프트 템플릿과 워크플로우 그래프가 포함된 파편화된 워크플로우를 대체합니다.