Multimodal
media MarkTechPost · há 5 d · 24 visualizações

Alibaba Qwen lança Qwen3.8-Omni-Flash, um modelo omni-modal agêntico com contexto de 1M

A equipe Qwen da Alibaba lançou o Qwen3.8-Omni-Flash, seu primeiro modelo omni-modal projetado em torno de capacidades agênticas para compreensão áudio-vídeo e uso de ferramentas. O modelo aceita entradas de texto, imagens, áudio e vídeo para retornar saídas de texto, apresentando uma janela de contexto de 1M de tokens e chamada nativa de funções.

lab Tencent Hunyuan (HF) · há 6 d · 64 visualizações

Tencent lança WeVisDoc-4B, um analisador de documentos de ponta a ponta

A Tencent lançou o WeVisDoc-4B, um analisador de documentos de ponta a ponta para imagens de páginas que converte páginas em Markdown estruturado com fórmulas LaTeX e tabelas HTML. Fine-tuned a partir do Qwen3-VL-4B-Instruct, o modelo alcança uma pontuação geral de 95.38 no OmniDocBench v1.6 e ocupa o primeiro lugar entre os analisadores comparados em todas as quatro configurações relatadas.

lab IBM Research (Granite) · há 13 d · 24 visualizações

IBM e NASA lançam o modelo base lunar NASA-IBM Lunar Foundation Model como código aberto

A IBM e a NASA tornaram código aberto o modelo base lunar NASA-IBM Lunar Foundation Model, um sistema de IA que consolida décadas de dados lunares multimodais de missões dos EUA e do Japão em uma única representação. Construído sobre a arquitetura TerraMind da IBM, o modelo integra observações em diferentes escalas e ângulos de visão para enfrentar desafios como iluminação complexa e resolução de dados.

lab DeepSeek API Docs · há 13 d Codeforces (Elo) · 3471.0Elo · 51 visualizações

DeepSeek lança modelo V4.1-Flash com suporte multimodal nativo

A DeepSeek lançou oficialmente o modelo DeepSeek-V4.1-Flash, que serve como o menor membro de sua nova família de arquiteturas e apresenta compreensão visual multimodal nativa. Esta nova arquitetura é projetada para fornecer um teto de capacidade mais alto, velocidades de inferência mais rápidas, maior throughput e melhor potencial de escalabilidade para modelos maiores.

media MarkTechPost · há 18 d · 33 visualizações

Google lança compreensão de vídeo agêntico para modelos Gemini Flash

O Google lançou a compreensão de vídeo agêntico em seus modelos Gemini Flash, substituindo o método anterior de processamento estático por um sistema que navega pelas linhas do tempo dos vídeos sob demanda. Essa mudança permite que o modelo decida o que assistir, a qual taxa de quadros e por qual modalidade, em vez de ingerir toda a linha do tempo em uma única taxa fixa de um quadro por segundo.

arxiv arXiv cs.CL · há 19 d · 36 visualizações

VisCAD lança suíte de modelos fundamentais com inteligência multimodal para CAD industrial

Pesquisadores apresentam o VisCAD, uma suíte de modelos fundamentais projetada para oferecer ampla generalização e forte capacidade para o design realista de produtos industriais. A suíte aborda os desafios da geração em nível de peça a partir de entradas diversas, como renders e texto, bem como a geração em nível de montagem envolvendo peças interagentes.

lab Hugging Face Blog · há 20 d · 34 visualizações

NeoMME lança codificadores multimodais eficientes com recuperação de interação densa e tardia

Pesquisadores apresentam o NeoMME, uma família de codificadores multimodais multilíngues de 260M e 800M que processam texto e patches de imagem brutos usando um único Transformer bidirecional. Diferente dos modelos de linguagem visual generativos, o NeoMME não depende de torres de visão pré-treinadas separadas ou decodificadores causais, treinando todo o modelo do zero com um objetivo de difusão discreta mascarada.