Research paper
arxiv arXiv cs.AI · há 3 h WebArena · 45.3% · 13 visualizações

Growing Harness transforma o controle recorrente de agentes em código reutilizável por meio de treinamento guiado por falhas

Os autores apresentam o Growing Harness, um paradigma de treinamento que aprende a estrutura de controle de um agente a partir do feedback da tarefa, em vez de depender de harnesses padrão com grande carga contextual. Ao converter decisões de controle recorrentes em código executável e reservar chamadas de LLM para raciocínio semântico, o método visa criar agentes especialistas reutilizáveis.

arxiv arXiv cs.LG · há 4 h · 11 visualizações

AIDE^2 permite autoaperfeiçoamento recursivo de agentes de pesquisa com IA

Pesquisadores apresentam o AIDE^2, um sistema que implementa um ciclo de autoaperfeiçoamento recursivo para um agente de pesquisa de IA de ponta, otimizando seu próprio código. O sistema propõe alterações em sua lógica interna, avalia versões modificadas em tarefas de P&D de IA e retém apenas as atualizações que obtêm o melhor desempenho em avaliações ocultas.

arxiv arXiv cs.CL · há 7 h · 11 visualizações

TelecomGPT-R1: Pós-treinamento unificado para raciocínio em tarefas de telecomunicações heterogêneas

Pesquisadores apresentam o TelecomGPT-R1, uma família de modelos de raciocínio unificados de telecomunicações de código aberto, projetados para automatizar tarefas de engenharia por meio do raciocínio sobre padrões, configurações e logs. O modelo aborda as limitações dos LLMs generalistas e especializados existentes por meio de uma abordagem estruturada que abrange os eixos de protocolo, conhecimento, modelagem e falhas.

arxiv arXiv cs.LG · há 1 d HealthBench · 50.1% · 10 visualizações

Fathom-Vaidya melhora o raciocínio médico com recompensas baseadas em rubricas

Os autores apresentam o Fathom-Vaidya, um modelo de 30B parâmetros que utiliza dados sintéticos e aprendizado por reforço baseado em rubricas para aprimorar o raciocínio diagnóstico e clínico na saúde. A estrutura de treinamento primeiro aplica RL guiado por regras a perguntas derivadas do MedBullets para diagnóstico, depois utiliza 5.3k cenários sintéticos multi-turno com rubricas multidimensionais para tarefas clínicas interativas.

arxiv arXiv cs.AI · há 1 d HealthBench · 50.1% · 12 visualizações

Fathom-Vaidya melhora o raciocínio médico com recompensas baseadas em rubricas

Os autores apresentam o Fathom-Vaidya, um modelo de 30B parâmetros que utiliza dados sintéticos e aprendizado por reforço baseado em rubricas para aprimorar tanto o raciocínio diagnóstico quanto o clínico na saúde. A estrutura de treinamento primeiro visa a precisão diagnóstica usando perguntas derivadas do MedBullets e depois aborda interações clínicas multironda através de 5.3k cenários gerados com rubricas multidimensionais.

lab Microsoft Research Blog · há 2 d · 29 visualizações

Microsoft lança RetroChimera para previsão de retrosíntese

A Microsoft Research publicou e disponibilizou como código aberto o RetroChimera, um novo framework para previsão de retrosíntese que combina dois modelos complementares para propor rotas de síntese de alta qualidade. O sistema integra R-SMILES 2, um modelo de-novo baseado em Transformer, com NeuralLoc, um modelo baseado em rede neural gráfica (GNN), utilizando uma estratégia de ensembling aprendida para classificar as previsões.

arxiv arXiv cs.AI · há 2 d · 18 visualizações

CodeMidas escala ambientes de RL para codificação agêntica usando código-fonte

Pesquisadores apresentam o CodeMidas, um pipeline agêntico que constrói ambientes de aprendizado por reforço a partir da funcionalidade implementada em repositórios de código aberto, utilizando o código-fonte como única entrada. O método aloca computação agêntica para explorar a funcionalidade, construir testes fundamentados na execução e validar tarefas por meio de repetidas rollouts, resultando em um conjunto de dados com 5.545 tarefas de treinamento em 23 linguagens de programação. Treinar o MiMo-V2.5 nessas tarefas com GRPO melhora o desempenho em cinco benchmarks diversos, incluindo DeepSWE (+11,7%), ProgramBench (+17%) e Terminal-Bench v2.1 (+8,5%). A análise de trajetórias indica que o agente treinado com RL exibe comportamentos melhores, como maior exploração da base de código e autoverificação mais diversa. Esses resultados estabelecem o código-fonte como uma base escalável para a construção de ambientes de RL que melhoram agentes de codificação em diversas tarefas de software.

arxiv arXiv cs.CL · há 2 d · 10 visualizações

TrialAtlas: sistema multiagente melhora a avaliação de riscos no planejamento de ensaios clínicos

Pesquisadores apresentaram o TrialAtlas, uma organização de pesquisa multiagente com memória aprimorada, projetada para auxiliar no planejamento do desenvolvimento clínico (CDP). O sistema coordena agentes especializados para síntese de literatura, inteligência competitiva e análise regulatória, a fim de antecipar riscos no desenvolvimento.

media Hugging Face Forums · há 3 d · 16 visualizações

Pesquisador busca um único anotador independente para resolver ambiguidade de concordância em LLMs

Um pesquisador está solicitando que um único anotador humano independente rotule 100 cenas narrativas turcas para determinar se o baixo acordo entre avaliadores decorre da natureza interpretativa da tarefa ou de definições de anotação mal especificadas. O estudo constatou que quatro LLMs e um detector baseado em regras concordaram entre si e com a referência humana aproximadamente no nível do acaso, com escores de κ de Cohen variando de 0,000 a 0,185.

media Hugging Face Forums · há 3 d · 17 visualizações

GlucoEdge: previsão de tendência glicêmica em dispositivo com quantização INT8

O pesquisador independente Mohamed Menasy publicou o GlucoEdge, um estudo de engenharia que detalha um pipeline de aprendizado de máquina em dispositivo para previsão de tendência glicêmica de cinco classes e 15 minutos a partir de dados de monitor contínuo de glicose. O trabalho apresenta uma CNN 1D compacta com apenas 2.909 parâmetros e abrange o fluxo completo de trabalho, desde o PyTorch até a conversão para LiteRT.

arxiv arXiv cs.LG · há 7 d · 20 visualizações

OpenAI lança Open-1B com treinamento totalmente auditável

A OpenAI lançou o Open-1B, um modelo de linguagem treinado sob um regime onde cada operação durante o treinamento é reproduzível independentemente em hardware comercial heterogêneo com certeza bit a bit. Esta abordagem aborda os problemas de reprodutibilidade inerentes aos modelos de código aberto ao impor uma ordem definida sobre as fontes de não determinismo, como reduções de kernels de GPU e ordenação de lotes de dados.

arxiv arXiv cs.AI · há 8 d · 24 visualizações

Prévia do Atria Dawn: modelo de linguagem agêntico fundamental para pesquisa científica

O Atria Dawn Preview é um modelo de linguagem agêntico fundamental projetado para fluxos de trabalho de pesquisa científica e engenharia, treinado por meio de um Pipeline de Experiência Verificável que conecta interações mediadas por ferramentas a ambientes executáveis. Em 16 benchmarks que abrangem pesquisa do mundo real, engenharia e trabalho digital, o modelo é competitivo em relação aos agentes de ponta e alcança a maior pontuação relatada em cinco deles.