Um usuário demonstra a execução do modelo Qwen3.6-35B-A3B quantizado com NVFP4 em uma GPU RTX Pro 6000 Blackwell, atingindo aproximadamente 2000 tokens por segundo de throughput agregado ao lidar com 30 streams concorrentes de geração de legendas para imagens. A configuração utiliza vLLM com o backend de atenção FLASHINFER e cache de prefixos para gerenciar alta concorrência. A arquitetura Mixture of Experts (MoE) ativa apenas cerca de 53-61% dos especialistas mesmo em níveis altos de concorrência, permitindo que supere modelos densos apesar de sua maior contagem de parâmetros. Esta configuração prova que a quantização NVFP4 no hardware Blackwell pode lidar eficientemente com cargas de trabalho multimodais com paralelismo significativo sem esgotar a VRAM.
NVFP4 Qwen3.6-35B-A3B no Blackwell alcança ~2000 tps com 30 streams concorrentes
GGUF unificado e fork do llama.cpp habilitam áudio e vídeo para o Nemotron-3-Nano-Omni
O autor aborda falhas silenciosas nas versões populares do GGUF do Nemotron-3-Nano-Omni-30B, onde as entradas de áudio e vídeo eram ignoradas devido a arquivos de projetor incompletos e gráficos de inferência ausentes. Para corrigir isso, um arquivo mmproj unificado contendo a torre de visão, o codificador de áudio FastConformer completo e o incorporador de vídeo temporal foi lançado junto com um fork especializado do llama.cpp.
Zero-shot Nemotron 3.5 Lightning Omni adiciona visão e áudio via correspondência de geometria
O autor criou o Nemotron 3.5 Lightning-Omni anexando projetores pré-treinados do Nemotron-3-Nano-Omni da NVIDIA ao modelo Nemotron 3.5 Lightning apenas para texto, permitindo compreensão de imagens e áudio sem nenhum treinamento adicional.
NVIDIA serve Qwen 3.8 2.4T no GB300 NVL72 a 4K tokens/s por GPU
A NVIDIA demonstrou o serviço do modelo de parâmetros Qwen 3.8 2.4T com capacidades de raciocínio configuráveis em sua plataforma de hardware GB300 NVL72.
Microsoft lança Mage-VL, um modelo multimodal de streaming nativo para codec
A Microsoft lançou o Mage-VL, um modelo de fundação multimodal eficiente com 4B de parâmetros para compreensão de imagens e vídeos que utiliza uma abordagem nativa para codec a fim de simplificar o processamento visual. O sistema separa os fluxos de vídeo em quadros âncora (I) e quadros previstos (P), retendo apenas os patches onde o codec aloca bits, reduzindo o consumo de tokens visuais em mais de 75%.
Qwen3.6-27B sem ajuste supera Nemotron Puzzle-75B ajustado em tarefas de agente
Uma avaliação das capacidades de agente mostra que o modelo Qwen3.6-27B sem ajuste concluiu com sucesso todas as tarefas testadas usando 6-9 chamadas de ferramenta, enquanto o Nemotron Puzzle-75B ajustado exigiu prompts ajustados manualmente e significativamente mais rodadas para passar.