주제 · Research paper
lab Google DeepMind Blog · 8일 전 · 조회수 27회

Google DeepMind, 사이클론 예보를 위한 WeatherNext AI 모델을 오픈소스로 공개

Google DeepMind와 Google Research는 열대성 사이클론의 경로, 강도 및 바람 구조 예측에서 최첨단 정확도를 달성한 WeatherNext 2 및 WeatherNext Cyclones AI 모델을 오픈소스로 공개했습니다. Nature에 게재된 이 연구는 이러한 모델이 기존 시스템 대비 예보관에게 하루분의 예측 정확도를 추가로 제공함을 보여줍니다.

lab OpenAI News · 14일 전 · 조회수 23회

Astra 모델이 수학 및 이론 컴퓨터 과학의 열 가지 미해결 문제를 해결하다

OpenAI의 내부 Astra 모델은 수학 및 이론 컴퓨터 과학 전반에 걸쳐 오랫동안 미해결로 남아 있던 열 가지 문제에 대한 해답을 생성했으며, 그 논증은 Lean에서 형식화되었습니다. 이러한 결과는 고차원 기하학, 부호 이론, 군론, 양자 복잡성을 아우르며 최소 10년 동안 진전이 없었던 질문들을 다루고 있습니다.

lab NVIDIA Research · 5시간 전 · 조회수 1회

HorizonRelight는 일관된 장시간 비디오 리라이트를 위해 마스크된 자기 조건화를 사용합니다

연구원들은 작업을 시간 조건부 잠재 도메인 번역으로 재구성하여 장시간 비디오 리라이트의 시간적 불연속성을 해결합니다. 이 프레임워크는 경계를 통해 대상 도메인 잠재 변수를 전파하여 청크 간 연속성을 강제하고, 마스크된 대상 도메인 자기 조건화를 사용하여 이 동작을 학습 가능하게 만듭니다.

lab NVIDIA Research · 3일 전 · 조회수 38회

LLM이 하이퍼파라미터 최적화에서 베이지안 최적화와 동등하거나 이를 능가함

새로운 논문은 제한된 예산 설정에서 일반적으로 수동 접근 방식에 의존하는 프로세스인 하이퍼파라미터 최적화(HPO)를 자동화하기 위해 기초 대규모 언어 모델(LLM)을 사용하는 것을 탐구합니다. 저자들은 데이터셋 및 모델 설명에 기반하여 LLM이 하이퍼파라미터 구성을 제안하고, 이를 모델 성능에 따라 반복적으로 정제하는 방법론을 개발했습니다.

lab NVIDIA Research · 3일 전 · 조회수 40회

Source가 훈련 데이터 속성 추정을 위한 근사 언롤링 미분 도입

연구자들은 영향 함수의 계산 효율성과 언롤링 기반 접근법의 정확성을 결합한 새로운 훈련 데이터 속성 추정(TDA) 방법인 Source를 소개합니다. 영향 함수와 유사한 공식을 사용하여 언롤링 미분을 근사함으로써, Source는 최적화 편향이나 다단계 파이프라인을 고려하지 않는다는 암시적 미분 방법의 한계를 해결합니다.

lab NVIDIA Research · 3일 전 · 조회수 10회

NVIDIA, 자율주행 시뮬레이션을 위한 실시간 생성형 월드 모델 OmniDreams 출시

NVIDIA는 폐쇄 루프 시뮬레이션 내에서 자율 주행 정책의 평가 병목 현상을 해결하기 위해 설계된 파운데이션 생성형 월드 모델인 OmniDreams를 소개했습니다. 21,000시간의 주행 시나리오로 Cosmos 확산 모델을 중기 및 후기 학습한 이 모델은 실시간으로 행동 조건부 동영상을 자기회귀적으로 생성합니다.

lab Microsoft Research Blog · 3일 전 · 조회수 11회

마이크로소프트 리서치, 보조 감독과 도구 증강 측정을 갖춘 통합chest X-ray VLM인 CARE-X를 선보임

마이크로소프트 리서치는 생성적 보고서 작성과 보정된 진단 예측을 결합하여 현재 방사선학 비전-라이트 모델의 격차를 해결하도록 설계된 연구 모델인 CARE-X를 선보였습니다. 이 시스템은 임상적 정확성에 대한 보상을 위해 강화 학습(DAPO)을 사용하며, 정밀한 계산이 필요한 상태에 대한 성능 평가를 위해 Qwen3-VL-4B-Instruct 모델을 결정론적 측정 도구와 페어링합니다.

lab NVIDIA Research · 4일 전 · 조회수 14회

DSTP가 복잡한 MLLM 추론에서 시각적 토큰 가지치기 실패를 완화합니다

연구자들은 디코딩 중 관련 시각 정보 이동(RVIS)이 멀티모달 대규모 언어 모델(MLLM)에서 기존 시각적 토큰 가지치기 방법의 실패 주원인임을 확인했습니다. 이를 해결하기 위해 그들은 학습이 필요 없는 프레임워크인 Decoding-stage Shift-aware Token Pruning(DSTP)을 제안하며, 이는 시각적 토큰을 변화하는 추론 요구 사항과 정렬시킵니다.

lab NVIDIA Research · 4일 전 · 조회수 3회

GenRecal은 재보정을 통해 대규모 비전-언어 모델을 소규모 모델로 증류합니다

연구자들은 GenRecal을 제시했습니다. 이는 대규모 비전-언어 모델(VLM)에서 더 작고 효율적인 대응 모델로 지식을 전달하는 범용 증류 프레임워크입니다. 이 방법은 서로 다른 모델 유형 간에 특징 표현을 정렬하고 적응시키기 위한 Re-calibrator를 사용하여 이종 VLM 아키텍처의 과제를 해결합니다.

lab NVIDIA Research · 4일 전 · 조회수 9회

ZPPO는 작은 비전-언어 모델 학습을 개선하기 위해 그래디언트 대신 프롬프트를 사용한다

연구자들은 지식 증류의 취약성과 강화학습에서의 드리프트(drift) 문제를 해결하기 위해 정책 그래디언트가 아닌 프롬프트에 교사 지식을 주입하는 방법인 근접 정책 최적화 영역(Zone of Proximal Policy Optimization, ZPPO)을 소개한다. ZPPO는 어려운 질문에 대해 이진 후보 포함 질문(Binary Candidate-included Questions, BCQ)과 부정 후보 포함 질문(Negative Candidate-included Questions, NCQ)을 구성하고, 학생의 정확도가 향상되거나 제외될 때까지 리플레이 버퍼를 통해 이를 순환시킨다.

lab NVIDIA Research · 4일 전

Hide to See는 VLM 증류용 추론 접두사 마스킹을 도입합니다

연구자들은 시각적 증거를 활용하는 컴팩트한 비전-라ngu아지 모델의 능력을 향상시키는 새로운 생각-답변 증류 프레임워크를 제안했습니다. 이는 중요한 추론 접두사를 마스킹하여 달성됩니다. 이 접근 방식은 긴 생각-답변 추적에서 일반적으로 발생하는 "시각적 망각" 문제를 해결합니다. 학생들은 확장된 추론 동안 시각적 단서에 대한 집중력을 잃습니다.

lab NVIDIA Research · 4일 전 · 조회수 1회

SpatialClaw는 에이전트 공간 추론을 위해 코드를 액션 인터페이스로 사용

연구자들은 SpatialClaw를 제안했습니다. 이는 훈련 없는 프레임워크로, 비전-언어 모델에서 오픈 엔디드 3D 및 4D 공간 추론을 개선하기 위해 액션 인터페이스로 코드를 채택합니다. 기존 에이전트들이 단일 패스 실행이나 경직된 도구 호출에 의존하는 것과 달리, SpatialClaw는 입력 프레임과 지각 프리미티브가 사전 로드된 상태 유지 Python 커널을 유지합니다.