Tema · Training methods
lab NVIDIA Research · há 2 d · 38 visualizações

LLMs igualam ou superam a otimização bayesiana para otimização de hiperparâmetros

Um novo artigo explora o uso de modelos de linguagem grandes fundamentais (LLMs) para automatizar a otimização de hiperparâmetros (HPO), um processo que normalmente depende de abordagens manuais em configurações com orçamento limitado. Os autores desenvolveram uma metodologia onde os LLMs sugerem configurações de hiperparâmetros com base nas descrições do conjunto de dados e do modelo, que são então refinadas iterativamente de acordo com o desempenho do modelo.

lab NVIDIA Research · há 2 d · 40 visualizações

Fonte introduz diferenciação desenrolada aproximada para atribuição de dados de treinamento

Pesquisadores apresentam o Source, um novo método de atribuição de dados de treinamento (TDA) que combina a eficiência computacional das funções de influência com a precisão das abordagens baseadas em desenrolamento. Ao usar uma fórmula semelhante à função de influência para aproximar a diferenciação desenrolada, o Source aborda limitações nos métodos de diferenciação implícita, como sua falha em considerar o viés de otimização ou pipelines multiestágio.

lab NVIDIA Research · há 3 d · 12 visualizações

jlorraine apresenta ferramentas de otimização aninhada escaláveis para aprendizado profundo

O artigo introduz uma tese de jlorraine que aborda os desafios de aplicar otimização bilevel ou aninhada a configurações de aprendizado profundo em larga escala. Enquanto a otimização baseada em gradiente tipicamente atualiza um único conjunto de parâmetros, muitas aplicações exigem a atualização de subconjuntos de parâmetros em diferentes objetivos aninhados uns dentro dos outros.

lab NVIDIA Research · há 4 d · 9 visualizações

ZPPO usa prompts em vez de gradientes para melhorar o treinamento de modelos pequenos de visão e linguagem

Pesquisadores introduzem a Otimização de Política na Zona Próxima (ZPPO), um método que injeta conhecimento do professor nos prompts, em vez dos gradientes da política, para lidar com a fragilidade na destilação de conhecimento e no desvio no aprendizado por reforço. A ZPPO constrói Perguntas com Candidato Binário Incluído (BCQ) e Perguntas com Candidato Negativo Incluído (NCQ) para perguntas difíceis, recirculando-as por meio de um buffer de replay até que a precisão do aluno melhore ou sejam removidas.

lab Microsoft Research Blog · há 15 d · 4 visualizações

Microsoft Research apresenta EvoLib para aprendizado em tempo de teste com uma biblioteca em evolução

A Microsoft Research apresentou o EvoLib, um framework que permite que modelos de linguagem grandes aprendam com sua própria experiência durante a inferência, sem exigir rótulos de verdade fundamental ou feedback externo. Em vez de armazenar experiências brutas como memórias estáticas, o EvoLib as transforma em habilidades reutilizáveis e insights reflexivos que são continuamente refinados, consolidados e reponderados.

media Hugging Face Forums · há 1 d · 1 visualização

ThetaMem propõe elevações multiplicativas com sinal para memória de sequência de estado fixo

ThetaMem é um estudo preliminar, com semente única, de um misturador recorrente que modifica o estado recorrente por meio de elevações de chave aprendidas com Hadamard ou produto externo com sinal, em vez de refinar mecanismos de portão. O autor apresenta resultados mistos em benchmarks sintéticos e busca explicitamente críticas para identificar o experimento mais barato capaz de falsear a abordagem.

arxiv arXiv cs.AI · há 3 d

MiLMMT-46-v1.0 melhora a tradução multilíngue por meio de pós-treinamento sem referência

Pesquisadores desenvolveram o MiLMMT-46-v1.0, um modelo de tradução automática multilíngue que aplica pós-treinamento sem referência em grandes modelos de linguagem de código aberto. A equipe utiliza Otimização de Política Relativa de Grupo (GRPO) com uma recompensa baseada em dois modelos de estimativa de qualidade sem referência, controlada por identificação de idioma.

arxiv arXiv cs.CL · há 3 d · 1 visualização

MiLMMT-46-v1.0 melhora a tradução multilíngue por meio de pós-treinamento sem referência

Pesquisadores lançaram o MiLMMT-46-v1.0, um modelo de linguagem grande de código aberto para tradução automática multilíngue que utiliza pós-treinamento sem referência. Partindo do MiLMMT-46-v0.1 ajustado por supervisão, a equipe aplicou Group Relative Policy Optimization (GRPO) com uma recompensa baseada em dois modelos de estimativa de qualidade sem referência, controlados por identificação de idioma.

lab Hugging Face Blog · há 4 d · 8 visualizações

Multiverse Computing reduz VRAM de destilação de conhecimento com perda KL em blocos fundidos

A Multiverse Computing apresenta uma abordagem eficiente em memória para a destilação de conhecimento de modelos de linguagem grandes, combinando o cache offline de top-K logits com uma perda de divergência Kullback-Leibler (KL) em blocos fundidos. Este método elimina a necessidade de manter os modelos professor e aluno na memória simultaneamente, reduzindo drasticamente os requisitos de VRAM.

arxiv arXiv cs.LG · há 8 d

U-OPSD permite auto-distilação on-policy não supervisionada para LLMs

Pesquisadores propõem Auto-Distilação On-Policy Não Supervisionada (U-OPSD), um método que alcança melhoria no pós-treinamento para grandes modelos de linguagem usando apenas as próprias gerações do modelo, sem supervisão externa. A abordagem amostra múltiplas execuções para construir uma pseudo-solução por meio de votação majoritária, em seguida, destila a distribuição do professor nos prefixos do maior completamento incorreto do modelo.

media r/LocalLLaMA · há 11 d · 5 visualizações

AFM3 20B da Apple usa poda de seguimento de instruções para ativar ~20% das camadas

A Apple introduziu uma nova arquitetura para seus modelos fundamentais de terceira geração (AFM3) que utiliza "Poda de Seguimento de Instruções" para reduzir significativamente a contagem de parâmetros ativos. O modelo é projetado para ativar aproximadamente 20% de suas camadas MLP tomando decisões de roteamento uma vez por prompt, em vez de por token.

media Hugging Face Forums · há 14 d · 3 visualizações

PIN v2 desacopla a largura do modelo do custo de armazenamento por meio de amarração de pesos

A Arquitetura PIN v2 introduz um método para pré-selecionar o tamanho e a velocidade de inferência de uma rede neural antes do treinamento, utilizando amarração de pesos. Essa técnica força grupos de células a armazenar valores idênticos, permitindo que a rede mantenha sua largura enquanto reduz drasticamente o número de pesos armazenados.