Tema · Multimodal
lab Google DeepMind Blog · há 2 d · 13 visualizações

Google DeepMind lança modelo SL2T de tradução de língua de sinais para texto no Gboard e Live Transcribe

O Google DeepMind e o Android apresentaram o SL2T, um modelo de tradução de língua de sinais para texto (SL2T) massivamente multilíngue que leva a IA de língua de sinais aos produtos de consumo pela primeira vez. A tecnologia alimenta a ditatação de sinais para texto no Gboard e no Live Transcribe do Pixel 11, começando com American Sign Language (ASL) para inglês.

lab Google — The Keyword (AI) · há 3 d · 40 visualizações

Google demonstra capacidades de consulta clínica por vídeo em tempo real com o AMIE

O Google Research e o Google DeepMind avançaram sua pesquisa no sistema de IA médica AMIE para demonstrar capacidades de consulta clínica por vídeo em tempo real em um estudo inédito. Construído sobre Gemini e Project Astra usando uma arquitetura multiagente, o sistema interpreta sinais visuais e auditivos, orienta exames físicos virtuais e raciocina diagnosticamente em tempo real.

lab Microsoft Research Blog · há 3 d · 11 visualizações

Microsoft Research apresenta CARE-X, um VLM unificado de raios X torácico com supervisão auxiliar e medição aumentada por ferramentas

A Microsoft Research apresentou o CARE-X, um modelo de pesquisa projetado para preencher lacunas nos atuais modelos de visão e linguagem da radiologia, combinando a geração de relatórios generativos com previsões diagnósticas calibradas. O sistema utiliza aprendizado por reforço (DAPO) para recompensar a correção clínica e emparelha o modelo Qwen3-VL-4B-Instruct com ferramentas de medição determinísticas para avaliar o desempenho em condições que exigem cálculos precisos.

lab NVIDIA Research · há 3 d · 3 visualizações

GenRecal destila grandes modelos de visão e linguagem em pequenos por meio de recalibração

Pesquisadores apresentam o GenRecal, um framework de destilação de propósito geral que transfere conhecimento de grandes modelos de visão e linguagem (VLM) para contrapartes menores e mais eficientes. O método aborda o desafio das arquiteturas VLM heterogêneas usando um Recalibrator para alinhar e adaptar representações de características entre diferentes tipos de modelos.

lab NVIDIA Research · há 4 d

Hide to See introduz mascaramento de prefixo de raciocínio para destilação de VLM

Pesquisadores propõem um novo framework de destilação pensar-responder que melhora a capacidade de modelos visuo-linguísticos compactos de utilizar evidência visual ao mascarar prefixos de raciocínio salientes. Esta abordagem aborda o problema do "esquecimento visual" comum em rastros longos de pensar-responder, onde os estudantes perdem o foco nas pistas visuais durante o raciocínio estendido.

lab NVIDIA Research · há 18 d · 9 visualizações

NVIDIA apresenta o Spatial-IQ, um framework de diagnóstico hierárquico para raciocínio espacial em modelos multimodais

Pesquisadores da NVIDIA introduziram o Spatial-IQ, um framework de diagnóstico projetado para decompor a inteligência espacial de grandes modelos de linguagem multimodais (MLLMs). Diferente dos benchmarks existentes que tratam os modelos como caixas-pretas, esta abordagem decompõe a contagem de objetos em estruturas 3D empilhadas em nove sub-tarefas perceptivas e cognitivas alinhadas com estágios do desenvolvimento humano.

lab Google — The Keyword (AI) · há 23 d · 1 visualização

Google expande a automação de tarefas do Gemini Intelligence e traz o Notebook para dispositivos Galaxy

No Galaxy Unpacked 2026, a Google anunciou três atualizações para os novos Samsung Galaxy Z Fold8 Ultra, Fold8 e Flip8, com foco na implementação do Gemini Intelligence. A empresa está ampliando suas capacidades de automação de tarefas para suportar mais de 40 aplicativos populares e introduzindo o aplicativo Gemini Notebook diretamente nesses dispositivos.

lab Mistral AI News · há 10 d · 4 visualizações

Shieldstral apresenta classificador de segurança multimodal de 3B adaptável a políticas

O Shieldstral é um classificador de segurança multimodal de pesos abertos com 3B parâmetros que enquadra a moderação de conteúdo como uma tarefa de resposta a perguntas adaptável a políticas, permitindo aceitar políticas em linguagem natural durante a inferência sem necessidade de retreinamento. Ele unifica a avaliação de segurança de texto e imagem e fornece pontuações de segurança calibradas em diversos benchmarks enquanto opera com eficiência em uma única GPU NVIDIA de 16GB.

media MarkTechPost · há 1 d IFEval · 82.3% · 1 visualização

Liquid AI lança LFM2.5-VL-3B, um modelo de visão e linguagem de 3B para dispositivos móveis com chamada de ferramentas

A Liquid AI lançou o LFM2.5-VL-3B, um modelo de visão e linguagem com 3,1 bilhões de parâmetros projetado para implantação eficiente em dispositivos. O modelo lê telas digitais em ambientes móveis, web e desktop, localiza objetos em coordenadas, analisa documentos e executa chamadas de ferramentas a partir de entradas de texto ou imagem.

arxiv arXiv cs.AI · há 2 d · 3 visualizações

SCUT melhora o raciocínio espacial em VLMs por meio de CoT estruturado e RL supervisionado por processo

Pesquisadores propõem o SCOUT, um framework que aprimora o raciocínio espacial de Modelos Visão-Linguagem ao combinar Chain-of-Thought estruturada com aprendizado por reforço de recompensa de processo multiobjetivo. Essa abordagem aborda problemas de atribuição de crédito em métodos de RL existentes e integra percepção de profundidade para compreensão 3D abrangente.

lab Hugging Face Blog · há 2 d · 14 visualizações

Liquid AI lança LFM2.5-VL-3B para capacidades de visão em borda mais rápidas

A Liquid AI lançou o LFM2.5-VL-3B, um modelo de visão e linguagem com 3 bilhões de parâmetros projetado para oferecer desempenho melhorado e mais rápido em dispositivos de borda. O modelo combina um codificador de visão SigLIP2 400M NaFlex com a estrutura principal de sua contraparte apenas de texto, treinado em aproximadamente 34 trilhões de tokens, incluindo quatro vezes mais dados de visão do que lançamentos anteriores.

lab Liquid AI · há 2 d Berkeley Function-Calling Leaderboard · 32.5% · 15 visualizações

LFM2.5-VL-3B melhora a compreensão de tela e a chamada de funções para implantação em dispositivos de borda

O LFM2.5-VL-3B é um novo modelo de visão e linguagem que oferece desempenho competitivo em comparação com modelos maiores, mantendo baixa latência para aplicações em tempo real e em dispositivos. Ele se baseia na versão anterior do LFM2-VL-3B com melhorias significativas na compreensão de tela, fundamentação (grounding), chamada de funções e capacidades de entrada de múltiplas imagens.

arxiv arXiv cs.AI · há 4 d

AMIE (Video) atinge desempenho de nível especialista em consultas médicas em tempo real

Pesquisadores demonstraram o primeiro sistema de IA de nível especialista para consultas clínicas de vídeo em tempo real usando AMIE (Video), um sistema multiagente baseado em Gemini que integra diálogo de baixa latência com percepção audiovisual em tempo real. Em um estudo randomizado de Exame Clínico Estruturado Objetivo envolvendo 30 médicos de atenção primária e 100 cenários, os avaliadores clínicos classificaram o sistema como equivalente ou superior aos médicos na coleta de histórico, diagnóstico, manejo e observação física.