Multimodal
media MarkTechPost · há 4 d · 1 visualização

NVIDIA lança Alpamayo 2 Super, um modelo VLA aberto de 34B para direção autônoma

A NVIDIA lançou o Alpamayo 2 Super, um modelo de visão-linguagem-ação (VLA) com 34 bilhões de parâmetros projetado para robotáxis e direção autônoma sob a licença OpenMDW-1.1. O modelo aborda eventos de cauda longa ao combinar uma espinha dorsal Cosmos 3 Super Reasoner de 32B com um decodificador de ação baseado em difusão de 2,3B para gerar trajetórias, explicações causais e meta-ações a partir de vídeos de múltiplas câmeras.

arxiv arXiv cs.AI · há 4 d

Video-DeepResearch apresenta agente multimodal para fluxos de vídeo contínuos

Pesquisadores apresentam o Video-DeepResearch (Video-DR), um framework que estende agentes multimodais de imagens estáticas para fluxos de vídeo contínuos, abordando viés de modalidade e vazamento de conhecimento paramétrico. O sistema emprega um pipeline de percepção-exploração desacoplado com desbloqueio de ferramentas por estágio para impor ancoragem visual entre quadros antes da recuperação na web.

lab Mistral AI News · há 5 d · 3 visualizações

Shieldstral apresenta classificador de segurança multimodal de 3B adaptável a políticas

O Shieldstral é um classificador de segurança multimodal de pesos abertos com 3B parâmetros que enquadra a moderação de conteúdo como uma tarefa de resposta a perguntas adaptável a políticas, permitindo aceitar políticas em linguagem natural durante a inferência sem necessidade de retreinamento. Ele unifica a avaliação de segurança de texto e imagem e fornece pontuações de segurança calibradas em diversos benchmarks enquanto opera com eficiência em uma única GPU NVIDIA de 16GB.

media MarkTechPost · há 6 d GPQA Diamond · 89.5% · 1 visualização

Thinking Machines Lab lança Inkling-Small, um modelo MoE multimodal de pesos abertos com 276B

O Thinking Machines Lab lançou o Inkling-Small, um modelo Mixture-of-Experts de pesos abertos com 276 bilhões de parâmetros totais e 12 bilhões de parâmetros ativos. O modelo é treinado para raciocinar nativamente sobre texto, imagens e áudio, apresentando uma janela de contexto de 1M tokens e esforço de pensamento ajustável.

media r/LocalLLaMA · há 12 d · 5 visualizações

Microsoft lança Mage-VL, um modelo multimodal de streaming nativo para codec

A Microsoft lançou o Mage-VL, um modelo de fundação multimodal eficiente com 4B de parâmetros para compreensão de imagens e vídeos que utiliza uma abordagem nativa para codec a fim de simplificar o processamento visual. O sistema separa os fluxos de vídeo em quadros âncora (I) e quadros previstos (P), retendo apenas os patches onde o codec aloca bits, reduzindo o consumo de tokens visuais em mais de 75%.

lab NVIDIA Research · há 12 d · 8 visualizações

NVIDIA apresenta o Spatial-IQ, um framework de diagnóstico hierárquico para raciocínio espacial em modelos multimodais

Pesquisadores da NVIDIA introduziram o Spatial-IQ, um framework de diagnóstico projetado para decompor a inteligência espacial de grandes modelos de linguagem multimodais (MLLMs). Diferente dos benchmarks existentes que tratam os modelos como caixas-pretas, esta abordagem decompõe a contagem de objetos em estruturas 3D empilhadas em nove sub-tarefas perceptivas e cognitivas alinhadas com estágios do desenvolvimento humano.

arxiv arXiv cs.AI · há 12 d · 1 visualização

ClinFusion apresenta MLLM centrado na visão para compreensão médica holística

Pesquisadores apresentam o ClinFusion, um modelo de linguagem multimodal grande centrado na visão, projetado para abordar os desafios da implementação de IA na prática clínica ao unificar a compreensão de imagens médicas 2D e 3D. O sistema possui um codificador visual em cascata composicional com um operador de Fusão de Localidade Espacialmente Consciente em Cascata e inclui um novo framework de avaliação composto por MedIF-Bench e métricas fundamentadas na região de interesse.

arxiv arXiv cs.CL · há 12 d · 1 visualização

ClinFusion: MLLM centrado na visão estabelece novo estado da arte em benchmarks médicos

Pesquisadores apresentam o ClinFusion, um modelo de linguagem grande multimodal centrado na visão, projetado para compreensão médica holística que unifica a análise de imagens 2D e nativas em 3D. O sistema utiliza um codificador visual em cascata composicional com um operador de Fusão de Localidade Espacialmente Consciente em Cascata para enfrentar os desafios da imagem médica heterogênea.

media MarkTechPost · há 14 d · 2 visualizações

Induction Labs lança Photon-1, um modelo de imaginação treinado em 18 anos de vídeo

A Induction Labs lançou o Photon-1, um transformador misto de especialistas (mixture-of-experts) esparso de 106B-A5B que aprende a simular ambientes de desktop e jogar jogos prevendo quadros futuros a partir de vídeos brutos sem rótulos de ação. O modelo utiliza quantização escalar finita para comprimir cada quadro em 960 tokens discretos, alcançando uma compressão mais de 100 vezes melhor do que as representações existentes, enquanto preserva detalhes de texto e layout.