Training methods
arxiv arXiv cs.LG · há 1 d HealthBench · 50.1% · 10 visualizações

Fathom-Vaidya melhora o raciocínio médico com recompensas baseadas em rubricas

Os autores apresentam o Fathom-Vaidya, um modelo de 30B parâmetros que utiliza dados sintéticos e aprendizado por reforço baseado em rubricas para aprimorar o raciocínio diagnóstico e clínico na saúde. A estrutura de treinamento primeiro aplica RL guiado por regras a perguntas derivadas do MedBullets para diagnóstico, depois utiliza 5.3k cenários sintéticos multi-turno com rubricas multidimensionais para tarefas clínicas interativas.

arxiv arXiv cs.AI · há 1 d HealthBench · 50.1% · 12 visualizações

Fathom-Vaidya melhora o raciocínio médico com recompensas baseadas em rubricas

Os autores apresentam o Fathom-Vaidya, um modelo de 30B parâmetros que utiliza dados sintéticos e aprendizado por reforço baseado em rubricas para aprimorar tanto o raciocínio diagnóstico quanto o clínico na saúde. A estrutura de treinamento primeiro visa a precisão diagnóstica usando perguntas derivadas do MedBullets e depois aborda interações clínicas multironda através de 5.3k cenários gerados com rubricas multidimensionais.

media Latent Space · há 1 d · 13 visualizações

TypeSafe AI apresenta Jev, um modelo System One treinado com Aprendizado por Reforço para Decisões Calibradas

A TypeSafe AI lançou o Jev, uma nova classe de modelos "System One" projetados para ambientes de produção. O CEO da empresa e coautor do artigo InstructGPT, Diogo Almeida, argumenta que os modelos atuais de ponta priorizaram alinhamento e recusas em detrimento da confiabilidade, levando a problemas como alucinações e sycophancy.

media MarkTechPost · há 6 d · 20 visualizações

OpenAI lança framework de divulgação de desalinhamento de modelos com 3 trilhas de revisão

A OpenAI introduziu um novo framework para rastrear, investigar e divulgar desalinhamento em seus modelos, acompanhado por seis relatórios detalhados de incidentes do treinamento de aprendizado por reforço. O sistema estabelece critérios e prazos específicos para divulgação pública, aplicando-se mesmo quando o comportamento não está totalmente explicado ou mitigado.

arxiv arXiv cs.LG · há 7 d · 20 visualizações

OpenAI lança Open-1B com treinamento totalmente auditável

A OpenAI lançou o Open-1B, um modelo de linguagem treinado sob um regime onde cada operação durante o treinamento é reproduzível independentemente em hardware comercial heterogêneo com certeza bit a bit. Esta abordagem aborda os problemas de reprodutibilidade inerentes aos modelos de código aberto ao impor uma ordem definida sobre as fontes de não determinismo, como reduções de kernels de GPU e ordenação de lotes de dados.

lab Hugging Face Blog · há 9 d · 16 visualizações

TRL v1.14 AsyncGRPOTrainer permite sincronização apenas com LoRA em Jobs do Hugging Face

O TRL v1.14 introduz suporte ao LoRA no AsyncGRPOTrainer, permitindo que ele treine um adaptador de Adaptação de Baixo Ranque e sincronize apenas esse pequeno arquivo com os workers de inferência do vLLM. Essa arquitetura desacopla os jobs de treinamento e geração em máquinas separadas, usando um Storage Bucket compartilhado como ponte de sistema de arquivos, eliminando a necessidade de NCCL ou comunicação direta de rede entre nós.

media Hugging Face Forums · há 11 d · 16 visualizações

pop123-ux lança 38 notebooks executáveis para aprender Hugging Face removendo abstrações

O usuário pop123-ux publicou um repositório de aprendizado contendo 38 notebooks executáveis projetados para ajudar os usuários a entender a pilha do Hugging Face removendo progressivamente as abstrações de alto nível. A coleção cobre um caminho desde componentes centrais como transformers e tokenizers até ajuste fino, PEFT, raciocínio/RL e trabalho em projetos de ponta a ponta.

media MarkTechPost · há 12 d Berkeley Function-Calling Leaderboard · 83.2% · 18 visualizações

Google Research lança o ToolGrad, um framework de geração de dados para uso de ferramentas

Pesquisadores do Google e de várias universidades japonesas apresentaram o ToolGrad, um framework que inverte o pipeline tradicional para a geração de conjuntos de dados de uso de ferramentas, construindo primeiro cadeias de API verificadas e, em seguida, escrevendo consultas de usuário correspondentes. Essa abordagem visa eliminar a ineficiência dos métodos baseados em consulta que frequentemente falham durante a exploração por agentes.

arxiv arXiv cs.CL · há 14 d SWE-bench Verified · 72.6% · 25 visualizações

ExecCritic usa RL específico por função para melhorar agentes de codificação por meio de reparo guiado por testes

Pesquisadores apresentam o ExecCritic, um framework que combina uma estrutura de testar-verificar-revisar com aprendizado por reforço específico por função para aprimorar agentes de codificação. O sistema separa a construção de testes do reparo do código-fonte, utilizando um agente Test para gerar testes nativos do repositório e um agente Repair para revisar o código com base no feedback de execução.