Multimodal
media MarkTechPost · 4일 전 · 조회수 1회

NVIDIA가 자율주행용 34B 오픈 VLA 모델인 Alpamayo 2 Super 출시

NVIDIA는 OpenMDW-1.1 라이선스 하에 로봇택시와 자율주행을 위해 설계된 340억 파라미터의 비전-언어-액션(VLA) 모델인 Alpamayo 2 Super를 출시했습니다. 이 모델은 32B Cosmos 3 Super Reasoner 백본과 2.3B 확산 기반 액션 디코더를 결합하여 다중 카메라 영상에서 궤적, 인과 설명 및 메타 액션을 생성함으로써 롱테일 이벤트에 대응합니다.

arxiv arXiv cs.AI · 4일 전

Video-DeepResearch가 연속 비디오 스트림을 위한 멀티모달 에이전트 소개

연구자들은 Video-DeepResearch (Video-DR)를 소개했는데, 이는 정적 이미지에서 연속 비디오 스트림으로 멀티모달 에이전트를 확장하는 프레임워크로, 모달 편향과 매개변수 지식 누수를 해결합니다. 이 시스템은 웹 검색 전에 프레임 간 시각적 기반을 확립하기 위해 단계별 도구 잠금 해제와 함께 분리된 지각-탐색 파이프라인을 사용합니다.

lab Mistral AI News · 5일 전 · 조회수 3회

Shieldstral이 정책 적응형 3B 다중 모달 안전 분류기 선보임

Shieldstral은 콘텐츠 검수를 정책 적응형 질문 답변 작업으로 구성하는 3B 오픈 가중치 다중 모달 안전 분류기로, 재학습 없이 추론 시 일반 언어 정책을 받아들일 수 있습니다. 이는 텍스트와 이미지 안전 평가를 통합하고 다양한 벤치마크에서 교정된 안전 점수를 제공하며 단일 16GB NVIDIA GPU에서 효율적으로 실행됩니다.

media MarkTechPost · 6일 전 GPQA Diamond · 89.5% · 조회수 1회

Thinking Machines Lab이 276B 오픈 가중치 멀티모달 MoE 모델인 Inkling-Small을 출시

Thinking Machines Lab은 총 2760억 개의 파라미터와 120억 개의 활성 파라미터를 가진 오픈 가중치 Mixture-of-Experts 모델인 Inkling-Small을 출시했습니다. 이 모델은 텍스트, 이미지, 오디오에 대해 네이티브 추론을 수행하도록 훈련되었으며, 1M 토큰 컨텍스트 윈도우와 조정 가능한 사고 노력을 특징으로 합니다.

media r/LocalLLaMA · 12일 전 · 조회수 5회

Microsoft가 코덱 네이티브 스트리밍 멀티모달 모델 Mage-VL을 출시하다

Microsoft는 이미지 및 비디오 이해를 위한 효율적인 4B 파라미터 멀티모달 파운데이션 모델인 Mage-VL을 출시했으며, 이는 시각적 처리를 간소화하기 위해 코덱 네이티브 접근 방식을 사용합니다. 이 시스템은 비디오 스트림을 앵커(I) 프레임과 예측(P) 프레임으로 분리하고, 코덱이 비트를 할당하는 패치만 유지하여 시각적 토큰 소비를 75% 이상 줄입니다.

lab NVIDIA Research · 12일 전 · 조회수 8회

NVIDIA는 다중 모달 모델의 공간 추론을 위한 계층적 진단 프레임워크인 Spatial-IQ를 출시했다

NVIDIA 연구진은 다중 모달 대규모 언어 모델(MLLMs)의 공간 지능을 해체하기 위해 설계된 진단 프레임워크인 Spatial-IQ를 출시했습니다. 모델을 블랙 박스로 취급하는 기존 벤치마크와 달리, 이 접근 방식은 쌓여 있는 3D 구조에서의 객체 카운팅을 인간 발달 단계와 일치하는 아홉 가지 지각 및 인지 하위 작업으로 분해합니다.

arxiv arXiv cs.AI · 12일 전 · 조회수 1회

ClinFusion이 전신 의학 이해를 위한 비전 중심 MLLM을 소개합니다

연구자들은 ClinFusion을 소개했습니다. 이는 2D와 3D 의료 영상 이해를 통합하여 임상 현장에 AI를 배포하는 과제를 해결하도록 설계된 비전 중심 멀티모달 대규모 언어 모델입니다. 이 시스템은 Cascade Spatial-Aware Locality Fusion 연산자를 갖춘 구성적 캐스케이디드 비전 인코더를 특징으로 하며, MedIF-Bench와 관심 영역 기반 지표로 구성된 새로운 평가 프레임워크를 포함합니다.

arxiv arXiv cs.CL · 12일 전 · 조회수 1회

ClinFusion: 비전 중심 MLLM이 의료 벤치마크에서 새로운 최첨단 기록 수립

연구자들은 ClinFusion을 소개했는데, 이는 2D와 네이티브 3D 이미지 분석을 통합하여 포괄적인 의료 이해를 위해 설계된 비전 중심 멀티모달 대규모 언어 모델입니다. 이 시스템은 이질적인 의료 영상 분석의 과제를 해결하기 위해 Cascade Spatial-Aware Locality Fusion 연산자가 포함된 구성적 캐스케이드 비전 인코더를 활용합니다.

media MarkTechPost · 14일 전 · 조회수 2회

Induction Labs가 18년 치 영상으로 학습된 상상 모델 Photon-1 출시

Induction Labs는 액션 레이블 없이 원시 영상에서 미래 프레임을 예측하여 데스크톱 환경을 시뮬레이션하고 게임을 플레이하는 방법을 학습하는 희소 106B-A5B 혼합 전문가(MoE) 트랜스포머인 Photon-1을 출시했습니다. 이 모델은 유한 스칼라 양자화를 사용하여 각 프레임을 960개의 이산 토큰으로 압축하며, 텍스트와 레이아웃 세부 사항을 보존하면서 기존 표현 방식보다 100배 이상 뛰어난 압축률을 달성합니다.