Fonte · arXiv cs.CL
arxiv arXiv cs.CL · há 28 d · 35 visualizações

Modelos NVIDIA Nemotron-3 alcançam desempenho de medalha de ouro em competições de programação do IOI

A NVIDIA desenvolveu pipelines de pós-treinamento para seus modelos de linguagem Nemotron-3-Nano-CC e Nemotron-3-Ultra-CC para se destacarem na programação competitiva. Ao combinar a curadoria de problemas em larga escala, rastros de raciocínio sintéticos, ajuste fino supervisionado e aprendizado por reforço, a equipe criou sistemas especializados capazes de raciocínio algorítmico de alto nível.

arxiv arXiv cs.CL · há 17 h · 1 visualização

Modelos de Linguagem Contextual gerenciam contexto nativamente como arquivos editáveis

Pesquisadores apresentam Modelos de Linguagem Contextual (CLMs), uma nova arquitetura que trata a janela de contexto do modelo como um arquivo editável, permitindo que o modelo faça atualizações irrestritas em sua própria memória. Essa abordagem transfere o gerenciamento de contexto do controle externo para o comportamento intrínseco do modelo, possibilitando tanto o aprendizado em contexto quanto o aprendizado paramétrico de estratégias de gerenciamento de contexto.

arxiv arXiv cs.CL · há 2 d · 1 visualização

Estudo revela divergência de política epistêmica na contaminação de LLMs multi-turno

Um estudo intitulado "Epistemic Policy Divergence in Multi-Turn LLM Contamination: A Protocol-Gradient Investigation" avalia como grandes modelos de linguagem lidam com premissas falsas injetadas no histórico da conversa, um modo de falha denominado contaminação em nível de sessão. Os pesquisadores testaram GPT-5.4 Mini, Gemini-3.1 Flash-Lite e GLM-4.5-Air em dez domínios de conhecimento usando 22.500 turnos com temperatura zero.

arxiv arXiv cs.CL · há 2 d SWE-bench Verified · 49.2% · 1 visualização

ROFT melhora modelos agênticos ajustando-os em explicações autogeradas

Pesquisadores investigam o Retrospection-Only Fine-Tuning (ROFT), um procedimento online mínimo onde um agente gera explicações retrospectivas de suas próprias experiências e é ajustado finamente usando apenas a perda de previsão do próximo token nesses tokens de explicação. Este método não requer professor externo ou atualização de política baseada em recompensa.

arxiv arXiv cs.CL · há 2 d · 1 visualização

Rep2Act alinha representações de VLM para melhorar a abstenção no novo benchmark VAD-R

Pesquisadores introduzem o Diagnóstico de Responsividade Visual com Raciocínios (VAD-R), um novo benchmark projetado para avaliar a capacidade dos modelos de visão e linguagem de se absterem de perguntas sem resposta sem usar atalhos. O estudo revela que, embora os estados ocultos possam distinguir a responsividade, os modelos atuais falham em traduzir isso em decisões explícitas.

arxiv arXiv cs.CL · há 3 d · 6 visualizações

Highlight-Then-Summarize comprime evidências para melhor compreensão de contexto longo

Pesquisadores propõem o Highlight-Then-Summarize (H2S), um paradigma de compressão-então-raciocínio que identifica evidências relevantes à pergunta e as integra em um resumo compacto antes de gerar uma resposta. Para apoiar essa abordagem, a equipe construiu o H2S-Dataset com 6.647 exemplos de 11 famílias de benchmarks e introduziu o H2S-RL para recompensas em nível de processo.

arxiv arXiv cs.CL · há 3 d · 7 visualizações

KuaFu comprime o comportamento do usuário em compreensão em escala de bilhões

A Tencent apresenta o KuaFu, uma camada unificada de compressão de comportamento que condensa o histórico bruto do usuário em representações compactas para agentes conversacionais e recomendadores. O sistema usa um projetor de dois eixos para comprimir cada item de comportamento em 2-4 tokens de largura 128-256, abordando gargalos no processamento de sequências longas para um bilhão de usuários.

arxiv arXiv cs.CL · há 6 d · 9 visualizações

Estrutura de ponte de coroutine vence o Track 2 do CAR-bench com 60,0% Pass^3

Uma nova estrutura de ponte de coroutine para agentes que utilizam ferramentas venceu o Track 2 da avaliação CAR-bench, alcançando uma pontuação de Pass@3 de 60,0% no conjunto oficial de testes ocultos. O sistema desacopla a invocação do modelo das viagens de ida e volta das ferramentas, fazendo com que o modelo emita programas Python que bloqueiam e retomam a execução entre as trocas do avaliador.

arxiv arXiv cs.CL · há 7 d · 8 visualizações

VHD-Play gera ambientes de RL agêntico a partir de mecanismos resolvidos

O VHD-Play é um pipeline que gera ambientes diversos de aprendizado por reforço agêntico ao amostrar e resolver modelos matemáticos antes de renderizar seus processos de decisão como ferramentas com estado. Essa abordagem garante que dinâmicas executáveis e referências de pontuação de trajetória sejam herdadas diretamente do modelo resolvido, abordando os problemas de desalinhamento comuns em pipelines de geração existentes.

arxiv arXiv cs.CL · há 7 d · 2 visualizações

Benchmark WebMRE revela reforço mútuo entre guia e ação em agentes web

Os autores apresentam o WebMRE, um benchmark offline com 541 tarefas e 5.293 passos derivados de trajetórias bem-sucedidas do WebArena, projetado para fornecer um protocolo determinístico para pontuar checkpoints de agentes web sem deriva do ambiente. Este framework combina frases-guia orientadas ao humano com ações fundamentadas para estudar o efeito de reforço mútuo entre elas.

arxiv arXiv cs.CL · há 7 d SWE-Lancer · 51.47% · 10 visualizações

SkillGym internaliza habilidades humanas em LLMs para resolução de problemas do mundo real

Pesquisadores apresentam o SkillGym, um framework que transforma habilidades de agentes escritas por humanos em ambientes de treinamento executáveis e verificáveis para agentes de modelos de linguagem grandes. O sistema utiliza um pipeline de habilidade para tarefa para instanciar tarefas concretas e verificar resultados com verificadores baseados em código.

arxiv arXiv cs.CL · há 8 d · 19 visualizações

TelecomGPT-R1: Pós-treinamento unificado para raciocínio em tarefas de telecomunicações heterogêneas

Pesquisadores apresentam o TelecomGPT-R1, uma família de modelos de raciocínio unificados de telecomunicações de código aberto, projetados para automatizar tarefas de engenharia por meio do raciocínio sobre padrões, configurações e logs. O modelo aborda as limitações dos LLMs generalistas e especializados existentes por meio de uma abordagem estruturada que abrange os eixos de protocolo, conhecimento, modelagem e falhas.

arxiv arXiv cs.CL · há 9 d · 15 visualizações

AgentRouter reduz custos de fluxos de trabalho agênticos em 72% por meio de roteamento de modelos em nível de etapa

Pesquisadores propõem o AgentRouter, um classificador leve que otimiza fluxos de trabalho agênticos multi-etapas ao rotear etapas individuais da trajetória para camadas apropriadas de modelos, em vez de usar um único modelo de fronteira para todas as tarefas. O sistema aborda a ineficiência dos sistemas empresariais que desperdiçam 60-80% de seu orçamento de inferência em subtarefas que modelos menores podem lidar igualmente bem.

arxiv arXiv cs.CL · há 10 d · 17 visualizações

NemotronLabs lança VoiceChat, um modelo aberto de fala-para-fala full-duplex com chamada de ferramentas

A NemotronLabs apresentou o VoiceChat, um modelo open-weight de fala-para-fala full-duplex projetado para integrar escuta, transcrição, raciocínio e fala dentro de uma arquitetura de streaming unificada. O sistema combina um codificador de streaming de áudio e um modelo de linguagem decoder-only com fluxos de saída especializados paralelos para texto do agente e chamadas de função estruturadas, além de um ramo auxiliar RNN-T para transcrição incremental do usuário.