Fonte · arXiv cs.LG
arxiv arXiv cs.LG · há 28 d · 73 visualizações

Modelos Nemotron-3 da NVIDIA alcançam pontuação de ouro e recorde humano em IOI 2026

Pesquisadores desenvolveram um pipeline de pós-treinamento para modelos de linguagem grandes que permite alcançar desempenho de medalha de ouro em programação competitiva. Ao combinar ajuste fino supervisionado, aprendizado por reforço e uma nova estratégia orientada por feedback chamada GenCorrect, o sistema supera os melhores participantes humanos no conjunto de problemas do IOI 2026.

arxiv arXiv cs.LG · há 6 d · 7 visualizações

Framework GRASP melhora o planejamento estratégico com IA agêntica em múltipso estágios

Pesquisadores apresentam o GRASP, um framework de planejamento multiestágio consciente da estratégia, projetado para gerar planos executáveis de linguagem natural de alta qualidade para tarefas complexas, desacoplando o pipeline em módulos especializados. O sistema pré-compila diretrizes macro globais por meio do GenPlan, explora estratégias localizadas através do RevPlan e avalia trajetórias usando um discriminador multicritério chamado VerPlan.

arxiv arXiv cs.LG · há 8 d · 22 visualizações

AIDE^2 permite autoaperfeiçoamento recursivo de agentes de pesquisa com IA

Pesquisadores apresentam o AIDE^2, um sistema que implementa um ciclo de autoaperfeiçoamento recursivo para um agente de pesquisa de IA de ponta, otimizando seu próprio código. O sistema propõe alterações em sua lógica interna, avalia versões modificadas em tarefas de P&D de IA e retém apenas as atualizações que obtêm o melhor desempenho em avaliações ocultas.

arxiv arXiv cs.LG · há 8 d · 21 visualizações

CliffCompaction reduz os custos de agentes de codificação de longo alcance em até 50% mantendo o desempenho

Pesquisadores apresentam o CliffCompaction, uma técnica de autocompactação projetada para agentes que lidam com milhões de tokens, que corta custos em até 50% sob contexto limitado. O método mantém ou melhora o desempenho no Terminal-Bench e alcança resultados de estado da arte no KernelBench ao manter a fidelidade das informações por meio de truncamento em vez de reformulação.

arxiv arXiv cs.LG · há 9 d HealthBench · 50.1% · 13 visualizações

Fathom-Vaidya melhora o raciocínio médico com recompensas baseadas em rubricas

Os autores apresentam o Fathom-Vaidya, um modelo de 30B parâmetros que utiliza dados sintéticos e aprendizado por reforço baseado em rubricas para aprimorar o raciocínio diagnóstico e clínico na saúde. A estrutura de treinamento primeiro aplica RL guiado por regras a perguntas derivadas do MedBullets para diagnóstico, depois utiliza 5.3k cenários sintéticos multi-turno com rubricas multidimensionais para tarefas clínicas interativas.

arxiv arXiv cs.LG · há 15 d · 28 visualizações

OpenAI lança Open-1B com treinamento totalmente auditável

A OpenAI lançou o Open-1B, um modelo de linguagem treinado sob um regime onde cada operação durante o treinamento é reproduzível independentemente em hardware comercial heterogêneo com certeza bit a bit. Esta abordagem aborda os problemas de reprodutibilidade inerentes aos modelos de código aberto ao impor uma ordem definida sobre as fontes de não determinismo, como reduções de kernels de GPU e ordenação de lotes de dados.

arxiv arXiv cs.LG · há 16 d Codeforces (Elo) · 98.2% · 29 visualizações

Coliseu Estelar: estrutura para muitos agentes voltada à pesquisa de matemática e ciência da computação teórica em longo prazo

Os autores apresentam o Coliseu Estelar, uma estrutura agnóstica a modelos projetada para distribuir a inferência ao longo de pesquisas de longo alcance em matemática e ciência da computação teórica. O sistema explora estratégias alternativas antes da construção da prova, utiliza um gate de prontidão para determinar quando uma rota está madura o suficiente para decomposição e representa o plano da prova como subproblemas interdependentes de nível de seção.

arxiv arXiv cs.LG · há 24 d · 33 visualizações

Método de Incerteza Especulativa reduz erros em agentes de engenharia de software usando gateamento por modelo rascunho

Os autores apresentam a Incerteza Especulativa (SU), uma técnica que recupera um sinal de falha preditiva para agentes LLM de caixa preta analisando apenas seus tokens de saída, sem exigir acesso a logits, pesos ou ativações. Ao inverter a decodificação especulativa, um pequeno modelo rascunho de pesos abertos pontua a trajetória do agente em uma única passagem direta para extrair características sensíveis à fase e calibrá-las contra um objetivo verificável.

arxiv arXiv cs.LG · há 27 d · 51 visualizações

FlashAttention-4 introduz Direct-P para inferência e treinamento de FP4 com consciência de hardware

O FlashAttention-4 aborda as limitações de desempenho dos núcleos de tensores de ponto flutuante de 4 bits (FP4) do Blackwell, introduzindo novos caminhos para inferência não causal e treinamento causal. O método, chamado Direct-P, mapeia escores diretamente para probabilidades FP4 para contornar os custos de conversão de softmax que normalmente dominam quando os produtos matriciais diminuem.

arxiv arXiv cs.LG · há 29 d SWE-bench Verified · 16.6% · 42 visualizações

CANOPY permite que Qwen3-14B domine o AppWorld usando apenas RL de resultado

O artigo apresenta o CANOPY (Coverage-ANchored On-PolicY RL), um protocolo que aborda a escassez de sinal e o desvio de política no aprendizado por reforço de longo prazo para modelos abertos pequenos. Ao ampliar a exploração na mesma tarefa e manter as atualizações ancoradas em KL, o método permite que os agentes aprendam eficazmente apenas com a verificação ao final da tarefa.