HorizonRelight는 일관된 장시간 비디오 리라이트를 위해 마스크된 자기 조건화를 사용합니다
연구원들은 작업을 시간 조건부 잠재 도메인 번역으로 재구성하여 장시간 비디오 리라이트의 시간적 불연속성을 해결합니다. 이 프레임워크는 경계를 통해 대상 도메인 잠재 변수를 전파하여 청크 간 연속성을 강제하고, 마스크된 대상 도메인 자기 조건화를 사용하여 이 동작을 학습 가능하게 만듭니다.
연구원들은 작업을 시간 조건부 잠재 도메인 번역으로 재구성하여 장시간 비디오 리라이트의 시간적 불연속성을 해결합니다. 이 프레임워크는 경계를 통해 대상 도메인 잠재 변수를 전파하여 청크 간 연속성을 강제하고, 마스크된 대상 도메인 자기 조건화를 사용하여 이 동작을 학습 가능하게 만듭니다.
엔비디아 연구진은 물리적으로 타당한 조명 전달과 정체성 보존, 그리고 컴팩트한 실시간 추론을 결합하는 초상화 재조명 방법인 FusionRelight를 소개했습니다. 이 접근 방식은 합성 데이터, One-Light-at-a-Time (OLAT) 데이터 및 자연 환경(in-the-wild) 데이터에서 물리, 반사율, 현실감 사전 지식을 학생 모델로 증류하는 학습 프레임워크인 하이브리드 도메인 지식 융합(HDKF)을 활용합니다.
NVIDIA는 폐쇄 루프 시뮬레이션 내에서 자율 주행 정책의 평가 병목 현상을 해결하기 위해 설계된 파운데이션 생성형 월드 모델인 OmniDreams를 소개했습니다. 21,000시간의 주행 시나리오로 Cosmos 확산 모델을 중기 및 후기 학습한 이 모델은 실시간으로 행동 조건부 동영상을 자기회귀적으로 생성합니다.
NVIDIA 연구진은 다중 모달 대규모 언어 모델(MLLMs)의 공간 지능을 해체하기 위해 설계된 진단 프레임워크인 Spatial-IQ를 출시했습니다. 모델을 블랙 박스로 취급하는 기존 벤치마크와 달리, 이 접근 방식은 쌓여 있는 3D 구조에서의 객체 카운팅을 인간 발달 단계와 일치하는 아홉 가지 지각 및 인지 하위 작업으로 분해합니다.
연구자들은 가우시안 프리미티브 기반 이미지 압축의 레이트-왜곡 성능을 개선하도록 설계된 Cluster-Guided Vector Quantization (CGVQ)를 제시합니다. 이 접근 방식은 양자화 전에 가우시안 매개변수를 동질적인 그룹으로 분할하여 프리미티브당 많은 부동 소수점 매개변수를 저장함으로써 발생하는 비효율성을 해결합니다.
연구자들은 경쟁 슈팅 게임 Delta Force의 게임플레이 비디오를 분석하여 제스처와 이동 패턴과 같은emergent한 비언어적 의사소통을 추출하고 이해합니다. 이 작업은 주로 MOBA 게임이나 다른 슈터 게임에서의 언어적 협조에 초점을 맞춘 기존 연구의 gap을 해결합니다.
NVIDIA의 연구원들은 경쟁적인 그룹 플레이 일정 조정 및 실험실 환경 재현의 어려움을 해결하기 위해 현장 실험 방법론을 채택하고 있습니다. 이 접근 방식은 실험을 토너먼트 구조에 직접 통합하여 하이브리드 토너먼트-실험을 생성합니다.
연구자들은 The AI Telco Engineer (AITE)를 소개했습니다. 이는 대규모 언어 모델 기반 진화 검색을 사용하여 성능-복잡성 간 균형을 맞추면서 복잡한 통신 문제에 대한 알고리즘을 자율적으로 설계하는 프레임워크입니다.
NVIDIA는 상호작용형 게임 환경 내에서 생성형 AI 시스템을 제어하는 과제를 해결하기 위해 설계된 프레임워크인 CTRL-G(Controllable Generative Graphics for Games)를 출시했습니다.
Anthropic은 Claude Fable 5의 성능에 근접하면서도 가격이 절반인 더 효율적인 모델인 Claude Opus 5를 출시했으며, 이는 Claude Max의 기본 모델이 되었습니다. 동시에 NVIDIA는 혁신을 장려하고 미국이 해당 부문에서 주도권을 강화할 수 있도록 오픈 가중치 AI 모델을 지원하는 미국 정부 정책을 촉구하고 있습니다.
NVIDIA는 메모리가 제한된 엣지 시스템에서 데이터 센터 수준의 성능을 제공하도록 설계된 40억 파라미터의 오픈 월드 모델인 Cosmos 3 Edge를 출시했습니다. 이 모델은 로봇과 비전 AI 에이전트가 주변 환경을 이해하고, 실시간으로 추론하며, NVIDIA Jetson 모듈과 같은 디바이스에서 직접 행동을 생성할 수 있게 합니다.
NVIDIA는 생산 규모의 RAG, 에이전트 검색, 코드 검색 및 에이전트 메모리를 위한 검색 품질을 개선하도록 설계된 오픈 및 상용 임베딩 모델 컬렉션인 Nemotron 3 Embed를 출시했습니다. 이 컬렉션에는 RTEB 리더보드에서 종합 1위를 차지한 8B 모델과 배포를 위해 최적화된 효율적인 1B 변형이 포함되어 있습니다.
llama.cpp 프로젝트는 OpenVINO 백엔드에 상당한 업데이트를 병합했으며, 주로 Qwen3.5 모델 계열에 대한 지원을 활성화하고 여러 메모리 최적화 기법을 도입했습니다.
알리바바는 오픈 생태계에 최전선 수준의 능력을 제공하도록 설계된 가장 큰 오픈 가중치 모델인 Qwen3.8-2.4T-A95B(Qwen3.8-Max로도 알려짐)의 오픈 가중치를 출시했습니다.
NVIDIA는 항상 켜져 있는 AI 에이전트를 구축하기 위해 설계된 두 가지 오픈소스 아티팩트인 Nemotron 3.5 Lightning 모델과 NeMo Switchyard 라우팅 라이브러리를 출시했습니다. 이 도구들은 긴 실행 중인 에이전트 워크플로우의 모든 단계를 최첨단 추론 모델로 전송하는 데 따른 높은 비용과 지연 시간을 전문화된 실행 및 라우팅 기능을 제공하여 해결합니다.
NVIDIA가 Hugging Face에 Nemotron-3.5-Lightning-30B-A3B 모델을 출시했습니다.
NVIDIA는 Magpie 다국어 TTS 모델의 업데이트를 출시하여 현대 표준 아랍어, 한국어, 브라질 포르투갈어를 추가해 총 12개 언어로 지원을 확대했습니다. 이번 릴리스는 업데이트된 학습 데이터와 아키텍처 변경을 통해 기존 언어 전반에 걸쳐 품질을 개선했습니다.
Meta는 로컬 AI 에이전트 작업을 위해 설계된 120K+ 컨텍스트 윈도우를 가진 30B 밀집 모델인 Muse Glimmer을 출시했습니다. NVIDIA 엣지, 데스크톱 및 워크스테이션 플랫폼에서 실행하도록 최적화되어 단일 GPU에서 초당 20K 토큰을 제공합니다.
NVIDIA는 실시간 풀듀플렉스 대화를 위해 설계된 오픈 11B 파라미터 엔드투엔드 음성-음성 모델인 NemotronLabs VoiceChat 11B를 출시했습니다. ASR, LLM 및 TTS를 체이닝하는 캐스케이디드 스택과 달리, 이 통합 네트워크는 스트리밍 음성을 동시에 이해하고 생성하며, Full-Duplex-Bench 1.0에서 측정된 부드러운 턴테이킹 지연시간은 448ms입니다.
NVIDIA Labs는 모델 비종속성(model-agnostic) Python 프레임워크인 NOOA(NVIDIA Object-Oriented Agents)를 오픈소스로 공개했으며, 이는 에이전트 개발을 단일 Python 클래스로 통합합니다. 이 접근 방식은 메서드를 액션에, 필드를 상태에, docstrings를 프롬프트에, 타입 어노테이션을 강제 계약에 매핑함으로써 프롬프트 템플릿과 워크플로우 그래프가 포함된 파편화된 워크플로우를 대체합니다.