Alibaba anuncia Qwen 4 na Conferência Apsara
A Alibaba anunciou oficialmente o lançamento do Qwen 4 durante a Conferência Apsara.
A Alibaba anunciou oficialmente o lançamento do Qwen 4 durante a Conferência Apsara.
A equipe Qwen da Alibaba lançou o Qwen3.8-Omni-Flash, seu primeiro modelo omni-modal projetado em torno de capacidades agênticas para compreensão áudio-vídeo e uso de ferramentas. O modelo aceita entradas de texto, imagens, áudio e vídeo para retornar saídas de texto, apresentando uma janela de contexto de 1M de tokens e chamada nativa de funções.
A equipe Qwen da Alibaba lançou o Qwen-Audio-3.1, uma pilha de áudio com cinco modelos que inclui o novo Qwen-Audio-3.1-Realtime-plus, um modelo de fala full-duplex projetado para agentes de voz capazes de raciocínio e uso de ferramentas. O lançamento também introduz reduções de preço de até 95% nos serviços de ASR.
O Laboratório de Algoritmos Profundos e Sistemas da ISTA lançou versões GGUF quantizadas do modelo mistura esparsa de especialistas Qwen3.8-Flash-Next, juntamente com uma compilação experimental voltada a capacidades específicas, com metade de seus especialistas removidos.
Os autores apresentam o RareDx, um sistema que acopla o uso controlado de evidências com otimização de política fundamentada em grafos de conhecimento para abordar o problema de raciocínio de cauda longa no diagnóstico de doenças raras. O pipeline de treinamento combina Top-10 pós-treinamento com RareDx-KGPO, que projeta previsões em um grafo canônico de doenças e integra relevância graduada curada, proximidade ontológica, similaridade biomédica e consistência fenotípica.
Pesquisadores introduzem o Diagnóstico de Responsividade Visual com Raciocínios (VAD-R), um novo benchmark projetado para avaliar a capacidade dos modelos de visão e linguagem de se absterem de perguntas sem resposta sem usar atalhos. O estudo revela que, embora os estados ocultos possam distinguir a responsividade, os modelos atuais falham em traduzir isso em decisões explícitas.
O VHD-Play é um pipeline que gera ambientes diversos de aprendizado por reforço agêntico ao amostrar e resolver modelos matemáticos antes de renderizar seus processos de decisão como ferramentas com estado. Essa abordagem garante que dinâmicas executáveis e referências de pontuação de trajetória sejam herdadas diretamente do modelo resolvido, abordando os problemas de desalinhamento comuns em pipelines de geração existentes.
Pesquisadores apresentam o SkillGym, um framework que transforma habilidades de agentes escritas por humanos em ambientes de treinamento executáveis e verificáveis para agentes de modelos de linguagem grandes. O sistema utiliza um pipeline de habilidade para tarefa para instanciar tarefas concretas e verificar resultados com verificadores baseados em código.
Pesquisadores apresentam o VideoX-Qwen, uma estrutura integrada que combina construção escalável de dados com treinamento de modelo para avançar na edição de vídeo de propósito geral e orientada por instruções. O sistema utiliza um pipeline de produção que organiza modelos especializados para gerar registros de edição direcional, resultando em mais de 1,2 milhão de amostras de alta qualidade nas tarefas de adição, remoção, substituição e atributos.
A Alibaba Cloud apresentou o Qwen3.8-Omni-Flash, um modelo agêntico multimodal nativo projetado para tarefas de produtividade do mundo real que melhora substancialmente a compreensão e o raciocínio multimodal em comparação com os modelos omni anteriores.
A Alibaba anunciou planos para desenvolver um modelo de inteligência artificial contendo entre 5 e 10 trilhões de parâmetros. Junto com este roteiro, a empresa também apresentou um novo chip personalizado projetado para apoiar suas necessidades de infraestrutura.
A equipe Qwen da Alibaba lançou o Qwen-Image-2.1, um modelo unificado de geração de imagem a partir de texto e edição de imagens que consolida os checkpoints anteriores separados em um único transformer de difusão com 7B de parâmetros.
A Qwen lançou o Qwen-Image-2.1, um modelo unificado projetado tanto para geração quanto para edição de imagens.
A equipe Qwen da Alibaba lançou o Qwen3.8-LiveTranslate, um modelo de interpretação simultânea em tempo real de próxima geração que ouve fala ao vivo e retorna texto e áudio traduzidos enquanto o falante ainda está falando. O lançamento introduz uma nova arquitetura Interleave projetada para reduzir a latência e melhorar a qualidade da tradução.
A Alibaba lançou um modelo de inteligência artificial médica de código-fonte aberto capaz de detectar câncer e aproximadamente outras 150 condições médicas.
O modelo Qwen3.8 Max (0902) alcançou uma pontuação de 45 no Índice de Inteligência da Artificial Analysis, retomando o primeiro lugar no ranking da China.
O TRL v1.14 introduz suporte ao LoRA no AsyncGRPOTrainer, permitindo que ele treine um adaptador de Adaptação de Baixo Ranque e sincronize apenas esse pequeno arquivo com os workers de inferência do vLLM. Essa arquitetura desacopla os jobs de treinamento e geração em máquinas separadas, usando um Storage Bucket compartilhado como ponte de sistema de arquivos, eliminando a necessidade de NCCL ou comunicação direta de rede entre nós.
Um estudo caracteriza os "FragileTokens", entradas do vocabulário em modelos de linguagem de peso aberto que copiam com sucesso quando isolados, mas exibem erros quando inseridos no texto circundante. A pesquisa destaca que a preservação literal da identidade não é garantida por testes de isolamento padrão, pois tokens podem ser excluídos, substituídos ou truncados dentro de sequências.
O ExecCritic apresenta um framework que separa a construção de testes do reparo do código-fonte para evitar confiança falsa em agentes de codificação. O sistema emprega um agente Test e um agente Repair, ambos apoiados pelo Qwen-3.5-35B-A3B, treinados separadamente usando aprendizado por reforço.
Pesquisadores apresentam o ExecCritic, um framework que combina uma estrutura de testar-verificar-revisar com aprendizado por reforço específico por função para aprimorar agentes de codificação. O sistema separa a construção de testes do reparo do código-fonte, utilizando um agente Test para gerar testes nativos do repositório e um agente Repair para revisar o código com base no feedback de execução.