한 사용자가 RTX Pro 6000 Blackwell GPU에서 NVFP4 양자화된 Qwen3.6-35B-A3B 모델을 실행하여 30개의 동시 이미지 캡션 스트림을 처리하는 동안 총 처리량으로 초당 약 2000개의 토큰을 달성했습니다. 이 구성은 높은 동시성을 관리하기 위해 FLASHINFER 어텐션 백엔드와 프리픽스 캐싱을 사용하는 vLLM을 활용합니다. Mixture of Experts (MoE) 아키텍처는 높은 동시성 수준에서도 약 53-61%의 전문가만 활성화되므로, 더 큰 매개변수 수에도 불구하고 밀집 모델보다 성능이 우수합니다. 이 설정은 Blackwell 하드웨어에서 NVFP4 양자화가 VRAM을 고갈시키지 않고 상당한 병렬성을 가진 멀티모달 워크로드를 효율적으로 처리할 수 있음을 증명합니다.
Blackwell에서 NVFP4 Qwen3.6-35B-A3B가 30개 동시 스트림으로 ~2000 tps 달성
통합 GGUF 및 llama.cpp 포크가 Nemotron-3-Nano-Omni에 오디오 및 비디오 지원 가능
저자는 불완전한 프로젝터 파일과 누락된 추론 그래프로 인해 오디오 및 비디오 입력이 무시되는 Nemotron-3-Nano-Omni-30B의 인기 있는 GGUF 버전에서 발생한 침묵하는 오류를 해결합니다. 이를 위해 비전 타워, 전체 Parakeet/FastConformer 오디오 인코더, 그리고 시간적 비디오 임베더가 포함된 통합 mmproj 파일과 전용 llama.cpp 포크가 함께 출시되었습니다.
Zero-shot Nemotron 3.5 Lightning Omni, 기하학적 매칭을 통해 시각 및 오디오 기능 추가
저자는 NVIDIA의 Nemotron-3-Nano-Omni에서 사전 훈련된 프로젝터를 텍스트 전용 Nemotron 3.5 Lightning 모델에 연결하여 Nemotron 3.5 Lightning-Omni를 만들었으며, 이는 추가 학습 없이 이미지와 오디오 이해를 가능하게 합니다.
NVIDIA, GB300 NVL72에서 GPU당 4K tok/s로 Qwen 3.8 2.4T 서빙
NVIDIA는 구성 가능한 추론 기능을 갖춘 Qwen 3.8 2.4T 파라미터 모델을 자체 GB300 NVL72 하드웨어 플랫폼에서 서빙하는 것을 시연했습니다.
Microsoft가 코덱 네이티브 스트리밍 멀티모달 모델 Mage-VL을 출시하다
Microsoft는 이미지 및 비디오 이해를 위한 효율적인 4B 파라미터 멀티모달 파운데이션 모델인 Mage-VL을 출시했으며, 이는 시각적 처리를 간소화하기 위해 코덱 네이티브 접근 방식을 사용합니다. 이 시스템은 비디오 스트림을 앵커(I) 프레임과 예측(P) 프레임으로 분리하고, 코덱이 비트를 할당하는 패치만 유지하여 시각적 토큰 소비를 75% 이상 줄입니다.
튜닝되지 않은 Qwen3.6-27B가 에이전트 작업에서 튜닝된 Nemotron Puzzle-75B를 능가
에이전트 기능 평가 결과, 튜닝되지 않은 Qwen3.6-27B 모델은 6~9회의 도구 호출을 사용하여 테스트된 모든 작업을 성공적으로 완료한 반면, 튜닝된 Nemotron Puzzle-75B는 수동으로 조정된 프롬프트와 훨씬 더 많은 턴 수를 필요로 했습니다.