Training methods
arxiv arXiv cs.LG · há 2 d

U-OPSD permite auto-distilação on-policy não supervisionada para LLMs

Pesquisadores propõem Auto-Distilação On-Policy Não Supervisionada (U-OPSD), um método que alcança melhoria no pós-treinamento para grandes modelos de linguagem usando apenas as próprias gerações do modelo, sem supervisão externa. A abordagem amostra múltiplas execuções para construir uma pseudo-solução por meio de votação majoritária, em seguida, destila a distribuição do professor nos prefixos do maior completamento incorreto do modelo.

arxiv arXiv cs.CL · há 9 d · 2 visualizações

Memory Decoder em Escala: Ampliando a memória paramétrica de longo prazo para 6,9B parâmetros

Pesquisadores apresentam o Memory Decoder at Scale, um sistema que amplia modelos de memória paramétrica de longo prazo até 6,9B parâmetros e os pré-treina em 300B tokens. Para lidar com a inviabilidade dos pipelines padrão do Faiss nessa escala de dados, os autores implementam um pipeline de indexação distribuído com carregamento esparsa e por lotes das distribuições kNN.

lab Microsoft Research Blog · há 9 d · 3 visualizações

Microsoft Research apresenta EvoLib para aprendizado em tempo de teste com uma biblioteca em evolução

A Microsoft Research apresentou o EvoLib, um framework que permite que modelos de linguagem grandes aprendam com sua própria experiência durante a inferência, sem exigir rótulos de verdade fundamental ou feedback externo. Em vez de armazenar experiências brutas como memórias estáticas, o EvoLib as transforma em habilidades reutilizáveis e insights reflexivos que são continuamente refinados, consolidados e reponderados.

arxiv arXiv cs.CL · há 11 d

Relay-OPD reduz o comprimento da trajetória de treinamento em mais de 50% na destilação on-policy

Pesquisadores introduzem a Destilação On-Policy com Relay (Relay-OPD) para abordar a falha de prefixo na destilação on-policy padrão, onde os erros do estudante levam a uma supervisão não confiável. O método utiliza uma assimetria de continuação entre professor e estudante como gatilho para que o professor assuma brevemente o controle e redirecione a trajetória antes que o estudante retome.

arxiv arXiv cs.CL · há 13 d OSWorld · 37.7%

OpenForgeRL permite o treinamento de ponta a ponta de agentes baseados em harness em qualquer ambiente

O OpenForgeRL é um framework de código aberto que permite aos pesquisadores treinar agentes de IA baseados em harness de ponta a ponta usando pilhas padrão de aprendizado por reforço. Ele desacopla o treinamento da inferência ao empregar um proxy leve para registrar as chamadas do modelo como dados e um orquestrador Kubernetes para gerenciar as execuções em contêineres remotos.

media Hugging Face Forums · há 14 d GSM8K · 74.22%

CrowdTensor lança Beta de treinamento voluntário e RFC de Campanha Qwen2.5-7B GSM8K em rascunho

O CrowdTensor é um protocolo open-source Apache-2.0 para campanhas de treinamento de modelos por voluntários com checkpoints, que vincula revisões imutáveis de modelo e dados para fornecer a células CPU, GPU ou TPU admitidas trabalho limitado. O projeto lançou um processo de inscrição Beta junto com uma RFC em rascunho para uma campanha Qwen2.5-7B GSM8K.

media Hugging Face Forums · há 15 d

ThetaScan v0.1 lança memória não linear com escaneamento paralelo e resultados de LM de 17M

Um pré-lançamento de pesquisa do ThetaScan v0.1, um misturador de tokens não linear de estado fixo, foi lançado como uma implementação de código aberto. A arquitetura garante que cada token compute sua gravação de memória a partir da entrada atual e dos parâmetros compartilhados, em vez de um estado rápido em evolução, permitindo que as gravações se componham por meio de um escaneamento de prefixo associativo.

arxiv arXiv cs.CL · há 16 d SWE-bench Pro · 55.9% · 2 visualizações

OpenForgeRL permite treinamento de ponta a ponta de agentes baseados em harness em qualquer ambiente

Pesquisadores apresentam o OpenForgeRL, um framework de código aberto que permite o treinamento de ponta a ponta de agentes de IA usando harnesses de inferência complexos como Claude Code e OpenClaw. O sistema desacopla o treinamento da inferência empregando um proxy leve para registrar chamadas do modelo como dados e um orquestrador Kubernetes para gerenciar implantações remotas de contêineres.

arxiv arXiv cs.AI · há 16 d OSWorld · 37.7% · 5 visualizações

OpenForgeRL permite o treinamento de ponta a ponta de agentes baseados em harness em qualquer ambiente

O OpenForgeRL é um framework de código aberto que permite aos pesquisadores treinar agentes de IA baseados em harness de ponta a ponta usando pilhas padrão de aprendizado por reforço. Ele alcança isso desacoplando o treinamento da inferência por meio de um proxy leve que registra as chamadas do modelo como dados e um orquestrador Kubernetes que gerencia os lançamentos remotos de contêineres.

arxiv arXiv cs.AI · há 17 d · 4 visualizações

SLAI T-Rex permite o pós-treinamento de todos os parâmetros do DeepSeek-V4 no Ascend SuperPOD

O SLAI apresenta o T-Rex, um framework de otimização de ponta a ponta para o pós-treinamento de todos os parâmetros de modelos MoE na escala de trilhões de parâmetros no Ascend NPU SuperPOD. Utilizando a família de modelos DeepSeek-V4 como carga de trabalho alvo, o sistema aborda a pressão de memória e a sobrecarga de comunicação por meio de paralelismo hierárquico e otimizações de execução de kernels.