Laboratório · Alibaba (Qwen)
media MarkTechPost · há 12 d · 35 visualizações

Alibaba Qwen lança Qwen3.8-Omni-Flash, um modelo omni-modal agêntico com contexto de 1M

A equipe Qwen da Alibaba lançou o Qwen3.8-Omni-Flash, seu primeiro modelo omni-modal projetado em torno de capacidades agênticas para compreensão áudio-vídeo e uso de ferramentas. O modelo aceita entradas de texto, imagens, áudio e vídeo para retornar saídas de texto, apresentando uma janela de contexto de 1M de tokens e chamada nativa de funções.

arxiv arXiv cs.AI · há 2 d · 1 visualização

RareDx usa otimização de política baseada em grafos para melhorar o diagnóstico de doenças raras

Os autores apresentam o RareDx, um sistema que acopla o uso controlado de evidências com otimização de política fundamentada em grafos de conhecimento para abordar o problema de raciocínio de cauda longa no diagnóstico de doenças raras. O pipeline de treinamento combina Top-10 pós-treinamento com RareDx-KGPO, que projeta previsões em um grafo canônico de doenças e integra relevância graduada curada, proximidade ontológica, similaridade biomédica e consistência fenotípica.

arxiv arXiv cs.CL · há 2 d · 1 visualização

Rep2Act alinha representações de VLM para melhorar a abstenção no novo benchmark VAD-R

Pesquisadores introduzem o Diagnóstico de Responsividade Visual com Raciocínios (VAD-R), um novo benchmark projetado para avaliar a capacidade dos modelos de visão e linguagem de se absterem de perguntas sem resposta sem usar atalhos. O estudo revela que, embora os estados ocultos possam distinguir a responsividade, os modelos atuais falham em traduzir isso em decisões explícitas.

arxiv arXiv cs.CL · há 7 d · 8 visualizações

VHD-Play gera ambientes de RL agêntico a partir de mecanismos resolvidos

O VHD-Play é um pipeline que gera ambientes diversos de aprendizado por reforço agêntico ao amostrar e resolver modelos matemáticos antes de renderizar seus processos de decisão como ferramentas com estado. Essa abordagem garante que dinâmicas executáveis e referências de pontuação de trajetória sejam herdadas diretamente do modelo resolvido, abordando os problemas de desalinhamento comuns em pipelines de geração existentes.

arxiv arXiv cs.CL · há 7 d SWE-Lancer · 51.47% · 10 visualizações

SkillGym internaliza habilidades humanas em LLMs para resolução de problemas do mundo real

Pesquisadores apresentam o SkillGym, um framework que transforma habilidades de agentes escritas por humanos em ambientes de treinamento executáveis e verificáveis para agentes de modelos de linguagem grandes. O sistema utiliza um pipeline de habilidade para tarefa para instanciar tarefas concretas e verificar resultados com verificadores baseados em código.

arxiv arXiv cs.AI · há 8 d · 17 visualizações

VideoX-Qwen apresenta estrutura centrada em dados para edição de vídeo baseada em instruções

Pesquisadores apresentam o VideoX-Qwen, uma estrutura integrada que combina construção escalável de dados com treinamento de modelo para avançar na edição de vídeo de propósito geral e orientada por instruções. O sistema utiliza um pipeline de produção que organiza modelos especializados para gerar registros de edição direcional, resultando em mais de 1,2 milhão de amostras de alta qualidade nas tarefas de adição, remoção, substituição e atributos.

lab Hugging Face Blog · há 16 d · 19 visualizações

TRL v1.14 AsyncGRPOTrainer permite sincronização apenas com LoRA em Jobs do Hugging Face

O TRL v1.14 introduz suporte ao LoRA no AsyncGRPOTrainer, permitindo que ele treine um adaptador de Adaptação de Baixo Ranque e sincronize apenas esse pequeno arquivo com os workers de inferência do vLLM. Essa arquitetura desacopla os jobs de treinamento e geração em máquinas separadas, usando um Storage Bucket compartilhado como ponte de sistema de arquivos, eliminando a necessidade de NCCL ou comunicação direta de rede entre nós.

media Hugging Face Forums · há 17 d · 29 visualizações

Estudo identifica FragileTokens que falham na cópia contextual apesar de passar em testes de isolamento

Um estudo caracteriza os "FragileTokens", entradas do vocabulário em modelos de linguagem de peso aberto que copiam com sucesso quando isolados, mas exibem erros quando inseridos no texto circundante. A pesquisa destaca que a preservação literal da identidade não é garantida por testes de isolamento padrão, pois tokens podem ser excluídos, substituídos ou truncados dentro de sequências.

arxiv arXiv cs.CL · há 22 d SWE-bench Verified · 72.6% · 32 visualizações

ExecCritic usa RL específico por função para melhorar agentes de codificação por meio de reparo guiado por testes

Pesquisadores apresentam o ExecCritic, um framework que combina uma estrutura de testar-verificar-revisar com aprendizado por reforço específico por função para aprimorar agentes de codificação. O sistema separa a construção de testes do reparo do código-fonte, utilizando um agente Test para gerar testes nativos do repositório e um agente Repair para revisar o código com base no feedback de execução.