Fonte · arXiv cs.CL
arxiv arXiv cs.CL · há 18 h

Multiplicação de Matrizes Reduzida: Redução do Produto Matricial Adaptativo à Entrada para Inferência de LLMs

Pesquisadores propõem a Multiplicação de Matrizes Reduzida (RMM), um método de inferência adaptativo à entrada e sem treinamento que reduz os produtos matriciais dos Transformers ao selecionar fatias informativas ao longo das dimensões de contração, sem modificar os pesos do modelo. Sob um controle simples da taxa de retenção, o RMM oferece uma troca suave e previsível entre precisão e eficiência em modelos de linguagem que variam de 1B a 70B parâmetros.

arxiv arXiv cs.CL · há 19 h

Intern-S2-Preview apresenta modelo de base agênico científico com pré-treinamento multimodal e RL

Os autores apresentam o Intern-S2-Preview, uma série de modelos de base agênicos científicos projetados para apoiar a compreensão multimodal científica, raciocínio, geração e tarefas de longo prazo. O pipeline de treinamento começa com o pré-treinamento multimodal científico sobre documentos científicos renderizados, dados de imagem-texto intercalados e corpora científicos diversos.

arxiv arXiv cs.CL · há 3 d · 1 visualização

MiLMMT-46-v1.0 melhora a tradução multilíngue por meio de pós-treinamento sem referência

Pesquisadores lançaram o MiLMMT-46-v1.0, um modelo de linguagem grande de código aberto para tradução automática multilíngue que utiliza pós-treinamento sem referência. Partindo do MiLMMT-46-v0.1 ajustado por supervisão, a equipe aplicou Group Relative Policy Optimization (GRPO) com uma recompensa baseada em dois modelos de estimativa de qualidade sem referência, controlados por identificação de idioma.

arxiv arXiv cs.CL · há 4 d · 10 visualizações

Macaron-V1 apresenta família aberta de modelos de agente com Mixture-of-LoRA para aprendizado contínuo

O Macaron-V1 é uma família aberta de modelos de agente projetada para inteligência experiencial, permitindo que sistemas aprendam com experiências do mundo real e continuem a melhorar após a implantação. A arquitetura se concentra em dois objetivos: adaptação por meio da autoaperfeiçoamento recursivo dos pares modelo-arneio, e colaboração por meio de um sistema Mixture-of-LoRA (MoL) que seleciona adaptadores especialistas por turno do usuário.

arxiv arXiv cs.CL · há 5 d · 8 visualizações

GPT-5 e GPT-5 Nano igualam especialistas na extração de evidências sobre oncogênese microbiana

Um estudo que avaliou modelos de linguagem grandes na síntese sistemática de evidências para oncogênese microbiana descobriu que o GPT-5 e o GPT-5 Nano têm desempenho indistinguível do de especialistas da área. Os pesquisadores avaliaram o Gemini 2.5 Pro, o Gemini 2.5 Flash, o GPT-5 e o GPT-5 Nano em 24 artigos de pesquisa, utilizando um modelo estruturado com 77 itens em múltiplos tipos de pergunta.

arxiv arXiv cs.CL · há 8 d · 4 visualizações

M$^3$R-Bench apresenta benchmark fundamentado em evidências para compreensão de metáforas multimodais

Pesquisadores apresentam o M$^3$R-Bench, um benchmark unificado contendo 1.000 instâncias de imagem-texto com anotações verificadas por humanos, projetado para avaliar a compreensão fundamentada em evidências de metáforas multimodais. O benchmark fornece anotações conjuntas para ocorrência de metáfora, mapeamento Alvo-Fonte, sentimento e explicações etapa a etapa baseadas na Teoria da Metáfora Conceitual.

arxiv arXiv cs.CL · há 15 d · 4 visualizações

Memory Decoder em Escala: Ampliando a memória paramétrica de longo prazo para 6,9B parâmetros

Pesquisadores apresentam o Memory Decoder at Scale, um sistema que amplia modelos de memória paramétrica de longo prazo até 6,9B parâmetros e os pré-treina em 300B tokens. Para lidar com a inviabilidade dos pipelines padrão do Faiss nessa escala de dados, os autores implementam um pipeline de indexação distribuído com carregamento esparsa e por lotes das distribuições kNN.

arxiv arXiv cs.CL · há 15 d MLE-bench · 71.21% · 3 visualizações

Frontis-MA1 alcança estado da arte em MLE por meio de autoaperfeiçoamento recursivo do OpenMLE

A Frontis lança o Frontis-MA1, um modelo AI4AI com 35B de parâmetros projetado para autoaperfeiçoamento recursivo em engenharia de machine learning, juntamente com a pilha open-source OpenMLE. O sistema integra ambientes de tarefa verificáveis, aprendizado de operadores e busca de longo alcance para permitir que um agente melhore seu próprio código por meio de treinamento fundamentado na execução.

arxiv arXiv cs.CL · há 15 d · 3 visualizações

OSReward introduz avaliação padronizada para modelos de recompensa de uso de computador entre plataformas

Pesquisadores apresentam o OSReward, um benchmark realista projetado para avaliar a confiabilidade de modelos de visão e linguagem (VLMs) atuando como juízes para trajetórias de agentes que utilizam computadores. O estudo revela que mesmo os VLMs mais avançados sofrem com viés sistemático de indulgência e são frequentemente caros demais para escala, enquanto modelos abertos acessíveis têm desempenho ruim.

arxiv arXiv cs.CL · há 16 d · 3 visualizações

Treinamento intermediário constitucional gera ganhos duráveis de alinhamento sem perda de capacidade

Pesquisadores testaram o treinamento intermediário constitucional inserindo conteúdo baseado em valores no processo de treinamento de modelos de escala 120B para determinar se ele produz um alinhamento mais durável do que os métodos padrão de pós-treinamento. O estudo descobriu que essa abordagem melhora significativamente a generalização e a durabilidade do alinhamento, especialmente na mitigação da propensão ao chantagem após o ajuste fino supervisionado.

arxiv arXiv cs.CL · há 17 d · 1 visualização

Relay-OPD reduz o comprimento da trajetória de treinamento em mais de 50% na destilação on-policy

Pesquisadores introduzem a Destilação On-Policy com Relay (Relay-OPD) para abordar a falha de prefixo na destilação on-policy padrão, onde os erros do estudante levam a uma supervisão não confiável. O método utiliza uma assimetria de continuação entre professor e estudante como gatilho para que o professor assuma brevemente o controle e redirecione a trajetória antes que o estudante retome.

arxiv arXiv cs.CL · há 18 d · 3 visualizações

PIVOT compartilha varreduras de prefixo entre grupos de consulta para acelerar a atenção esparsa em nível de token

O PIVOT (Proxy Indexing Via One full-prefix Traversal) é uma substituição plug-and-play sem treinamento para o indexador DeepSeek Sparse Attention (DSA) que reduz a redundância computacional ao compartilhar uma única varredura de prefixo entre um grupo de consultas próximas. Em vez de pontuar cada token precedente para cada consulta individualmente, o PIVOT agrega o grupo em uma única consulta proxy para obter um conjunto de candidatos, do qual os top-k tokens são selecionados para cada consulta.