Tema · Multimodal
lab DeepSeek API Docs · há 21 d Codeforces (Elo) · 3471.0Elo · 67 visualizações

DeepSeek lança modelo V4.1-Flash com suporte multimodal nativo

A DeepSeek lançou oficialmente o modelo DeepSeek-V4.1-Flash, que serve como o menor membro de sua nova família de arquiteturas e apresenta compreensão visual multimodal nativa. Esta nova arquitetura é projetada para fornecer um teto de capacidade mais alto, velocidades de inferência mais rápidas, maior throughput e melhor potencial de escalabilidade para modelos maiores.

lab Microsoft Research Blog · há 23 h · 3 visualizações

Microsoft Research apresenta Quine, um sistema de IA para pesquisa biológica multimodal

A Microsoft Research apresentou o Quine, um novo esforço de pesquisa projetado para criar um modelo de mundo multimodal da biologia e uma plataforma interativa que conecta modelos, ferramentas científicas, literatura e pesquisadores. O sistema visa preencher a lacuna entre a modelagem computacional e a experimentação do mundo real, permitindo que cientistas gerem propostas que são testadas em ambientes de laboratório úmido, com os resultados retroalimentando para refinar perguntas futuras.

media MarkTechPost · há 12 d · 35 visualizações

Alibaba Qwen lança Qwen3.8-Omni-Flash, um modelo omni-modal agêntico com contexto de 1M

A equipe Qwen da Alibaba lançou o Qwen3.8-Omni-Flash, seu primeiro modelo omni-modal projetado em torno de capacidades agênticas para compreensão áudio-vídeo e uso de ferramentas. O modelo aceita entradas de texto, imagens, áudio e vídeo para retornar saídas de texto, apresentando uma janela de contexto de 1M de tokens e chamada nativa de funções.

lab Hugging Face Blog · há 6 d · 13 visualizações

Liquid AI lança LFM2.5-VL-DSpark para acelerar a inferência de modelos de visão e linguagem

A Liquid AI lançou o modelo em rascunho LFM2.5-VL-DSpark, um drafter de decodificação especulativa projetado para acelerar a inferência do modelo de visão e linguagem LFM2.5-VL-3B. O drafter captura estados ocultos de camadas fixas do modelo alvo para gerar tokens candidatos, adicionando apenas 280M parâmetros (sobrecarga de 8,9%) enquanto mantém a dimensionalidade idêntica entre as modalidades.

lab Tencent Hunyuan (HF) · há 13 d · 78 visualizações

Tencent lança WeVisDoc-4B, um analisador de documentos de ponta a ponta

A Tencent lançou o WeVisDoc-4B, um analisador de documentos de ponta a ponta para imagens de páginas que converte páginas em Markdown estruturado com fórmulas LaTeX e tabelas HTML. Fine-tuned a partir do Qwen3-VL-4B-Instruct, o modelo alcança uma pontuação geral de 95.38 no OmniDocBench v1.6 e ocupa o primeiro lugar entre os analisadores comparados em todas as quatro configurações relatadas.

lab IBM Research (Granite) · há 20 d · 25 visualizações

IBM e NASA lançam o modelo base lunar NASA-IBM Lunar Foundation Model como código aberto

A IBM e a NASA tornaram código aberto o modelo base lunar NASA-IBM Lunar Foundation Model, um sistema de IA que consolida décadas de dados lunares multimodais de missões dos EUA e do Japão em uma única representação. Construído sobre a arquitetura TerraMind da IBM, o modelo integra observações em diferentes escalas e ângulos de visão para enfrentar desafios como iluminação complexa e resolução de dados.