Training methods
arxiv arXiv cs.LG · il y a 2 j

U-OPSD permet l'auto-distillation non supervisée sur politique pour les LLM

Les chercheurs proposent l'Auto-Distillation Non Supervisée sur Politique (U-OPSD), une méthode qui améliore les performances post-entraînement des grands modèles de langage en utilisant uniquement les générations du modèle lui-même, sans supervision externe. L'approche échantillonne plusieurs rollouts pour construire une pseudo-solution par vote majoritaire, puis distille la distribution d'un enseignant dans les préfixes de la complétion incorrecte la plus longue du modèle.

media r/LocalLLaMA · il y a 5 j

L'AFM3 20B d'Apple utilise l'élagage de suivi d'instructions pour activer ~20 % des couches

Apple a introduit une nouvelle architecture pour ses modèles fondamentaux de troisième génération (AFM3) qui utilise l'« Élagage de Suivi d'Instructions » pour réduire significativement le nombre de paramètres actifs. Le modèle est conçu pour activer environ 20 % de ses couches MLP en prenant des décisions de routage une fois par prompt plutôt que par token.

media Hugging Face Forums · il y a 8 j

Étudier si les traces d'échec des agents peuvent servir de données pour le réglage fin

L'auteur propose l'hypothèse selon laquelle les traces d'échec des agents utilisant des outils, telles que des sélections d'outils erronées ou des arguments malformés, peuvent constituer des données précieuses pour le réglage afin d'entraîner les modèles à éviter ces erreurs. L'article cherche à recueillir l'avis de la communauté sur l'efficacité ou les effets néfastes de l'entraînement sur des traces d'échec corrigées.

arxiv arXiv cs.CL · il y a 9 j · 2 vues

Mémoire à l'échelle : Passage à l'échelle des modèles de mémoire à long terme paramétrique jusqu'à 6,9 milliards de paramètres

Les chercheurs présentent Memory Decoder at Scale, un système qui met à l'échelle les modèles de mémoire à long terme paramétrique jusqu'à 6,9 milliards de paramètres et les pré-entraîne sur 300 milliards de tokens. Pour pallier l'irréalisme des pipelines Faiss standards à cette échelle de données, les auteurs implémentent un pipeline d'indexation distribué avec un chargement par lots et dispersé des distributions kNN.

lab Microsoft Research Blog · il y a 9 j · 3 vues

Microsoft Research présente EvoLib pour l'apprentissage au moment du test avec une bibliothèque évolutive

Microsoft Research a présenté EvoLib, un cadre qui permet aux grands modèles de langage d'apprendre de leur propre expérience pendant l'inférence sans nécessiter d'étiquettes de vérité terrain ni de retour externe. Au lieu de stocker les expériences brutes comme des mémoires statiques, EvoLib les transforme en compétences réutilisables et en réflexions qui sont continuellement affinées, consolidées et réévaluées.

arxiv arXiv cs.CL · il y a 11 j

Relay-OPD réduit la longueur de la trajectoire d'entraînement de plus de 50 % lors de la distillation on-policy

Les chercheurs introduisent la Distillation On-Policy par Relais (Relay-OPD) pour pallier l'échec du préfixe dans la distillation on-policy standard, où les erreurs de l'élève entraînent une supervision peu fiable. La méthode utilise une asymétrie de continuation professeur-élève comme déclencheur permettant au professeur d'intervenir brièvement pour rediriger la trajectoire avant que l'élève ne reprenne.

arxiv arXiv cs.CL · il y a 13 j OSWorld · 37.7%

OpenForgeRL permet l'entraînement de bout en bout d'agents à base de harnais dans n'importe quel environnement

OpenForgeRL est un framework open-source qui permet aux chercheurs d'entraîner des agents IA à base de harnais de bout en bout en utilisant des piles d'apprentissage par renforcement standard. Il découple l'entraînement de l'inférence en employant un proxy léger pour enregistrer les appels de modèle comme données et un orchestrateur Kubernetes pour gérer les déploiements dans des conteneurs distants.

media Hugging Face Forums · il y a 14 j GSM8K · 74.22%

CrowdTensor lance la bêta d'entraînement par volontaires et la RFC de campagne Draft Qwen2.5-7B GSM8K

CrowdTensor est un protocole open-source sous licence Apache-2.0 pour des campagnes d'entraînement de modèles par volontaires avec points de contrôle, qui lie des révisions immuables du modèle et des données afin de fournir aux cellules CPU, GPU ou TPU admises un travail borné. Le projet a publié un processus d'inscription en bêta ainsi qu'une RFC brouillon pour une campagne Qwen2.5-7B GSM8K.

media Hugging Face Forums · il y a 15 j

ThetaScan v0.1 publie une mémoire non linéaire parallélisée par balayage avec 17M de résultats LM

Un aperçu de recherche de ThetaScan v0.1, un mélangeur de tokens non linéaire à état fixe, a été publié en tant qu'implémentation open-source. L'architecture garantit que chaque token calcule son écriture de mémoire à partir de l'entrée actuelle et des paramètres partagés plutôt que d'un état rapide évolutif, permettant aux écritures de composer via un balayage de préfixe associatif.

arxiv arXiv cs.CL · il y a 16 j SWE-bench Pro · 55.9% · 2 vues

OpenForgeRL permet l'entraînement de bout en bout d'agents basés sur des harnais dans n'importe quel environnement

Les chercheurs présentent OpenForgeRL, un framework open-source qui permet l'entraînement de bout en bout d'agents IA à l'aide de harnais d'inférence complexes tels que Claude Code et OpenClaw. Le système découple l'entraînement de l'inférence en employant un proxy léger pour enregistrer les appels de modèle comme données et un orchestrateur Kubernetes pour gérer les déploiements de conteneurs distants.

arxiv arXiv cs.AI · il y a 16 j OSWorld · 37.7% · 5 vues

OpenForgeRL permet l'entraînement de bout en bout d'agents à base de harnais dans n'importe quel environnement

OpenForgeRL est un framework open-source qui permet aux chercheurs d'entraîner des agents IA à base de harnais de bout en bout en utilisant des piles standard de renforcement par apprentissage. Il y parvient en découplant l'entraînement de l'inférence grâce à un proxy léger qui enregistre les appels de modèle comme données et à un orchestrateur Kubernetes qui gère les déploiements de conteneurs distants.

media Hugging Face Forums · il y a 17 j

ELIZA avec autoencodeur clairsemé

Une nouvelle implémentation du chatbot ELIZA utilise une architecture d'autoencodeur clairsemé pour stocker les entrées de conversation dans une couche de mémoire latente, visant à améliorer les méthodes traditionnelles de correspondance de mots-clés. Le système emploie une structure encodeur-décodeur T5 avec une couche de mémoire de 32 768 neurones, où des entrées similaires sont activées via l'apprentissage contrastif.

arxiv arXiv cs.AI · il y a 17 j · 4 vues

SLAI T-Rex permet le post-entraînement à paramètres complets de DeepSeek-V4 sur Ascend SuperPOD

SLAI présente T-Rex, un framework d'optimisation de bout en bout pour le post-entraînement à paramètres complets de modèles MoE à l'échelle du trillion de paramètres sur Ascend NPU SuperPOD. En utilisant la famille de modèles DeepSeek-V4 comme charge de travail cible, le système adresse la pression mémoire et les frais de communication grâce à un parallélisme hiérarchique et des optimisations d'exécution de noyaux.