Sujet · Training methods
lab NVIDIA Research · il y a 3 j · 38 vues

Les LLM égalent ou surpassent l'optimisation bayésienne pour l'optimisation des hyperparamètres

Un nouvel article explore l'utilisation de grands modèles linguistiques fondamentaux (LLM) pour automatiser l'optimisation des hyperparamètres (HPO), un processus qui repose généralement sur des approches manuelles dans des configurations à budget limité. Les auteurs ont développé une méthodologie où les LLM suggèrent des configurations d'hyperparamètres basées sur les descriptions du jeu de données et du modèle, qui sont ensuite affinées itérativement en fonction des performances du modèle.

lab NVIDIA Research · il y a 3 j · 40 vues

Source introduit la différenciation déroulée approximative pour l'attribution des données d'entraînement

Les chercheurs présentent Source, une nouvelle méthode d'attribution des données d'entraînement (TDA) qui combine l'efficacité computationnelle des fonctions d'influence avec la précision des approches basées sur le déroulement. En utilisant une formule similaire à la fonction d'influence pour approximer la différenciation déroulée, Source adresse les limitations des méthodes de différenciation implicite, telles que leur incapacité à prendre en compte le biais d'optimisation ou les pipelines multi-étapes.

lab NVIDIA Research · il y a 3 j · 12 vues

jlorraine présente des outils d'optimisation imbriquée évolutifs pour l'apprentissage profond

L'article introduit une thèse de jlorraine qui aborde les défis de l'application de l'optimisation à deux niveaux ou imbriquée aux configurations d'apprentissage profond à grande échelle. Alors que l'optimisation basée sur le gradient met généralement à jour un seul ensemble de paramètres, de nombreuses applications nécessitent la mise à jour de sous-ensembles de paramètres sur différents objectifs imbriqués les uns dans les autres.

lab NVIDIA Research · il y a 4 j · 9 vues

ZPPO utilise des invites au lieu de gradients pour améliorer l'entraînement de petits modèles vision-langage

Les chercheurs présentent la Zone of Proximal Policy Optimization (ZPPO), une méthode qui injecte les connaissances du professeur dans les invites plutôt que dans les gradients de politique, afin de pallier la fragilité de la distillation des connaissances et la dérive en apprentissage par renforcement. ZPPO construit des Binary Candidate-included Questions (BCQ) et des Negative Candidate-included Questions (NCQ) pour les questions difficiles, en les recirculant via un tampon de rejeu jusqu'à ce que la précision de l'étudiant s'améliore ou qu'elles soient évacuées.

lab Microsoft Research Blog · il y a 15 j · 4 vues

Microsoft Research présente EvoLib pour l'apprentissage au moment du test avec une bibliothèque évolutive

Microsoft Research a présenté EvoLib, un cadre qui permet aux grands modèles de langage d'apprendre de leur propre expérience pendant l'inférence sans nécessiter d'étiquettes de vérité terrain ni de retour externe. Au lieu de stocker les expériences brutes comme des mémoires statiques, EvoLib les transforme en compétences réutilisables et en réflexions qui sont continuellement affinées, consolidées et réévaluées.

media Hugging Face Forums · il y a 1 j · 1 vue

ThetaMem propose des relèvements multiplicatifs signés pour la mémoire de séquence à état fixe

ThetaMem est une étude préliminaire à graine unique d'un mélangeur récurrent qui modifie l'état récurrent par des relèvements de clé signés appris (Hadamard ou produit extérieur) plutôt que par l'affinement des mécanismes de gating. L'auteur présente des résultats mitigés sur des benchmarks synthétiques et cherche explicitement des critiques pour identifier l'expérience la moins coûteuse susceptible de falsifier l'approche.

media MarkTechPost · il y a 2 j · 6 vues

Dyna Robotics publie Dyna-2, un modèle d'action-monde pré-entraîné sur 1 million d'heures de vidéo humaine

Dyna Robotics a publié Dyna-2, un modèle d'action-monde pour la manipulation robotique qui a été pré-entraîné sur plus d'un million d'heures de vidéo égocentrique humaine. L'entreprise démontre que la vidéo humaine ordinaire peut remplacer les données étiquetées par action en établissant une loi d'échelle allant de 1 000 à 1 000 000 d'heures.

arxiv arXiv cs.AI · il y a 3 j

MiLMMT-46-v1.0 améliore la traduction multilingue grâce à un post-entraînement sans référence

Des chercheurs ont développé MiLMMT-46-v1.0, un modèle de traduction automatique multilingue qui applique un post-entraînement sans référence aux grands modèles de langage ouverts. L'équipe utilise l'optimisation de politique relative par groupe (GRPO) avec une récompense basée sur deux modèles d'estimation de la qualité sans référence, contrôlée par l'identification de la langue.

arxiv arXiv cs.CL · il y a 3 j · 1 vue

MiLMMT-46-v1.0 améliore la traduction multilingue grâce à un post-apprentissage sans référence

Les chercheurs ont publié MiLMMT-46-v1.0, un grand modèle de langage ouvert pour la traduction automatique multilingue qui utilise un post-apprentissage sans référence. À partir du MiLMMT-46-v0.1 finement ajusté par apprentissage supervisé, l'équipe a appliqué l'optimisation relative de politique de groupe (GRPO) avec une récompense basée sur deux modèles d'estimation de la qualité sans référence, contrôlés par identification de la langue.

lab Hugging Face Blog · il y a 5 j · 8 vues

Multiverse Computing réduit la VRAM de la distillation de connaissances par une perte KL fusionnée et fractionnée

Multiverse Computing présente une approche économe en mémoire pour la distillation de connaissances des grands modèles de langage, combinant la mise en cache hors ligne des logits top-K avec une perte de divergence Kullback-Leibler (KL) fusionnée et fractionnée. Cette méthode supprime le besoin de conserver simultanément les modèles enseignant et élève en mémoire, réduisant drastiquement les exigences en VRAM.

arxiv arXiv cs.LG · il y a 8 j

U-OPSD permet l'auto-distillation non supervisée sur politique pour les LLM

Les chercheurs proposent l'Auto-Distillation Non Supervisée sur Politique (U-OPSD), une méthode qui améliore les performances post-entraînement des grands modèles de langage en utilisant uniquement les générations du modèle lui-même, sans supervision externe. L'approche échantillonne plusieurs rollouts pour construire une pseudo-solution par vote majoritaire, puis distille la distribution d'un enseignant dans les préfixes de la complétion incorrecte la plus longue du modèle.

media r/LocalLLaMA · il y a 11 j · 5 vues

L'AFM3 20B d'Apple utilise l'élagage de suivi d'instructions pour activer ~20 % des couches

Apple a introduit une nouvelle architecture pour ses modèles fondamentaux de troisième génération (AFM3) qui utilise l'« Élagage de Suivi d'Instructions » pour réduire significativement le nombre de paramètres actifs. Le modèle est conçu pour activer environ 20 % de ses couches MLP en prenant des décisions de routage une fois par prompt plutôt que par token.

media Hugging Face Forums · il y a 13 j

Étudier si les traces d'échec des agents peuvent servir de données pour le réglage fin

L'auteur propose l'hypothèse selon laquelle les traces d'échec des agents utilisant des outils, telles que des sélections d'outils erronées ou des arguments malformés, peuvent constituer des données précieuses pour le réglage afin d'entraîner les modèles à éviter ces erreurs. L'article cherche à recueillir l'avis de la communauté sur l'efficacité ou les effets néfastes de l'entraînement sur des traces d'échec corrigées.

media Hugging Face Forums · il y a 14 j · 3 vues

PIN v2 découple la largeur du modèle du coût de stockage via le partage de poids

L'architecture PIN v2 introduit une méthode pour pré-sélectionner la taille et la vitesse d'inférence d'un réseau neuronal avant l'entraînement en utilisant le partage de poids. Cette technique force des groupes de cellules à contenir des valeurs identiques, permettant au réseau de maintenir sa largeur tout en réduisant drastiquement le nombre de poids stockés.