Tema · Training methods
arxiv arXiv cs.CL · há 16 h · 1 visualização

Modelos de Linguagem Contextual gerenciam contexto nativamente como arquivos editáveis

Pesquisadores apresentam Modelos de Linguagem Contextual (CLMs), uma nova arquitetura que trata a janela de contexto do modelo como um arquivo editável, permitindo que o modelo faça atualizações irrestritas em sua própria memória. Essa abordagem transfere o gerenciamento de contexto do controle externo para o comportamento intrínseco do modelo, possibilitando tanto o aprendizado em contexto quanto o aprendizado paramétrico de estratégias de gerenciamento de contexto.

arxiv arXiv cs.CL · há 2 d SWE-bench Verified · 49.2% · 1 visualização

ROFT melhora modelos agênticos ajustando-os em explicações autogeradas

Pesquisadores investigam o Retrospection-Only Fine-Tuning (ROFT), um procedimento online mínimo onde um agente gera explicações retrospectivas de suas próprias experiências e é ajustado finamente usando apenas a perda de previsão do próximo token nesses tokens de explicação. Este método não requer professor externo ou atualização de política baseada em recompensa.

arxiv arXiv cs.CL · há 7 d · 8 visualizações

VHD-Play gera ambientes de RL agêntico a partir de mecanismos resolvidos

O VHD-Play é um pipeline que gera ambientes diversos de aprendizado por reforço agêntico ao amostrar e resolver modelos matemáticos antes de renderizar seus processos de decisão como ferramentas com estado. Essa abordagem garante que dinâmicas executáveis e referências de pontuação de trajetória sejam herdadas diretamente do modelo resolvido, abordando os problemas de desalinhamento comuns em pipelines de geração existentes.

arxiv arXiv cs.CL · há 7 d SWE-Lancer · 51.47% · 10 visualizações

SkillGym internaliza habilidades humanas em LLMs para resolução de problemas do mundo real

Pesquisadores apresentam o SkillGym, um framework que transforma habilidades de agentes escritas por humanos em ambientes de treinamento executáveis e verificáveis para agentes de modelos de linguagem grandes. O sistema utiliza um pipeline de habilidade para tarefa para instanciar tarefas concretas e verificar resultados com verificadores baseados em código.

lab Hugging Face Blog · há 7 d · 16 visualizações

NVIDIA Warp e MjWarp permitem simulação de robótica paralela acelerada por GPU

O MuJoCo Warp (MJWarp), construído sobre o NVIDIA Warp, permite que modelos compatíveis do MuJoCo sejam executados em escala de GPU, viabilizando o avanço de centenas ou milhares de mundos de simulação independentes em uma única chamada. Essa arquitetura desloca o foco da minimização de latência para um único ambiente para a melhoria da taxa de transferência agregada, o que favorece o aprendizado por reforço e a amostragem em larga escala.

arxiv arXiv cs.LG · há 9 d HealthBench · 50.1% · 13 visualizações

Fathom-Vaidya melhora o raciocínio médico com recompensas baseadas em rubricas

Os autores apresentam o Fathom-Vaidya, um modelo de 30B parâmetros que utiliza dados sintéticos e aprendizado por reforço baseado em rubricas para aprimorar o raciocínio diagnóstico e clínico na saúde. A estrutura de treinamento primeiro aplica RL guiado por regras a perguntas derivadas do MedBullets para diagnóstico, depois utiliza 5.3k cenários sintéticos multi-turno com rubricas multidimensionais para tarefas clínicas interativas.

arxiv arXiv cs.AI · há 9 d HealthBench · 50.1% · 16 visualizações

Fathom-Vaidya melhora o raciocínio médico com recompensas baseadas em rubricas

Os autores apresentam o Fathom-Vaidya, um modelo de 30B parâmetros que utiliza dados sintéticos e aprendizado por reforço baseado em rubricas para aprimorar tanto o raciocínio diagnóstico quanto o clínico na saúde. A estrutura de treinamento primeiro visa a precisão diagnóstica usando perguntas derivadas do MedBullets e depois aborda interações clínicas multironda através de 5.3k cenários gerados com rubricas multidimensionais.

media Latent Space · há 9 d · 22 visualizações

TypeSafe AI apresenta Jev, um modelo System One treinado com Aprendizado por Reforço para Decisões Calibradas

A TypeSafe AI lançou o Jev, uma nova classe de modelos "System One" projetados para ambientes de produção. O CEO da empresa e coautor do artigo InstructGPT, Diogo Almeida, argumenta que os modelos atuais de ponta priorizaram alinhamento e recusas em detrimento da confiabilidade, levando a problemas como alucinações e sycophancy.

media MarkTechPost · há 13 d · 23 visualizações

OpenAI lança framework de divulgação de desalinhamento de modelos com 3 trilhas de revisão

A OpenAI introduziu um novo framework para rastrear, investigar e divulgar desalinhamento em seus modelos, acompanhado por seis relatórios detalhados de incidentes do treinamento de aprendizado por reforço. O sistema estabelece critérios e prazos específicos para divulgação pública, aplicando-se mesmo quando o comportamento não está totalmente explicado ou mitigado.

arxiv arXiv cs.LG · há 15 d · 28 visualizações

OpenAI lança Open-1B com treinamento totalmente auditável

A OpenAI lançou o Open-1B, um modelo de linguagem treinado sob um regime onde cada operação durante o treinamento é reproduzível independentemente em hardware comercial heterogêneo com certeza bit a bit. Esta abordagem aborda os problemas de reprodutibilidade inerentes aos modelos de código aberto ao impor uma ordem definida sobre as fontes de não determinismo, como reduções de kernels de GPU e ordenação de lotes de dados.