Training methods
arxiv arXiv cs.AI · il y a 22 h · 11 vues

Le Générateur d'État du Monde aligne les plans avec des mondes synthétiques pour améliorer le succès de l'agent

Le Générateur d'État du Monde (WSG) est un modèle qui maintient les plans des agents linguistiques alignés sur les règles de leur environnement d'exécution en réécrivant les états après des échecs. Il est entraîné sur 226K trajectoires extraites de sept domaines synthétiques où un programme applique des règles et vérifie l'atteignabilité de l'objectif.

arxiv arXiv cs.LG · il y a 1 j HealthBench · 50.1% · 10 vues

Fathom-Vaidya améliore le raisonnement médical avec des récompenses basées sur des grilles

Les auteurs présentent Fathom-Vaidya, un modèle de 30B paramètres qui utilise des données synthétiques et l'apprentissage par renforcement basé sur des grilles pour améliorer le raisonnement diagnostique et clinique en santé. Le cadre d'entraînement applique d'abord un RL guidé par des règles aux questions dérivées de MedBullets pour le diagnostic, puis utilise 5,3k scénarios synthétiques multi-tours avec des grilles multidimensionnelles pour les tâches cliniques interactives.

arxiv arXiv cs.AI · il y a 1 j HealthBench · 50.1% · 12 vues

Fathom-Vaidya améliore le raisonnement médical avec des récompenses basées sur des grilles

Les auteurs présentent Fathom-Vaidya, un modèle de 30B paramètres qui utilise des données synthétiques et l'apprentissage par renforcement basé sur des grilles pour améliorer à la fois le raisonnement diagnostique et clinique en santé. Le cadre d'entraînement cible d'abord la précision diagnostique en utilisant des questions dérivées de MedBullets, puis aborde les interactions cliniques multi-tours via 5,3k scénarios générés avec des grilles multidimensionnelles.

media Latent Space · il y a 1 j · 13 vues

TypeSafe AI présente Jev, un modèle System One entraîné par apprentissage par renforcement pour des décisions calibrées

TypeSafe AI a lancé Jev, une nouvelle classe de modèles « System One » conçue pour les environnements de production. Le PDG de l'entreprise et co-auteur de l'article sur InstructGPT, Diogo Almeida, soutient que les modèles de pointe actuels ont privilégié l'alignement et les refus au détriment de la fiabilité, ce qui entraîne des problèmes tels que les hallucinations et la complaisance.

media MarkTechPost · il y a 6 j · 20 vues

OpenAI publie un cadre de divulgation des désalignements de modèles avec 3 voies d'examen

OpenAI a présenté un nouveau cadre pour suivre, enquêter et divulguer les désalignements dans ses modèles, accompagné de six rapports détaillés sur des incidents liés à l'entraînement par apprentissage par renforcement. Le système établit des critères spécifiques et des délais pour la divulgation publique, s'appliquant même lorsque le comportement n'est pas entièrement expliqué ou atténué.

media Hugging Face Forums · il y a 7 j · 15 vues

ByteLex utilise la carte du tokeniser pour prédire et corriger les erreurs du modèle de bytes

Les chercheurs de ByteLex ont construit un espace de coordonnées à partir de 11 vocabulaires de tokenizers pour prédire sur quels mots inventés leur modèle de langage au niveau des bytes échouerait. La carte a obtenu une corrélation de Spearman de -0.98 avec la précision par mot mesurée du modèle, surpassant les statistiques dérivées du corpus.

arxiv arXiv cs.LG · il y a 7 j · 20 vues

OpenAI publie Open-1B avec un entraînement entièrement auditable

OpenAI a publié Open-1B, un modèle de langage entraîné selon un régime où chaque opération pendant l'entraînement est reproductible indépendamment sur du matériel hétérogène standard avec une certitude bit à bit. Cette approche traite des problèmes de reproductibilité inhérents aux modèles open-source en imposant un ordre défini aux sources de non-déterminisme, telles que les réductions de noyaux GPU et l'ordre des lots de données.

lab Hugging Face Blog · il y a 9 j · 16 vues

TRL v1.14 AsyncGRPOTrainer permet la synchronisation uniquement LoRA sur les Jobs Hugging Face

TRL v1.14 introduit le support de LoRA pour l'AsyncGRPOTrainer, lui permettant d'entraîner un adaptateur Low-Rank Adaptation et de synchroniser uniquement ce petit fichier avec les workers d'inférence vLLM. Cette architecture découple les tâches d'entraînement et de génération sur des machines séparées en utilisant un Storage Bucket partagé comme pont de système de fichiers, éliminant ainsi le besoin de NCCL ou de communication réseau directe entre les nœuds.

media Hugging Face Forums · il y a 11 j · 16 vues

pop123-ux publie 38 notebooks exécutables pour apprendre Hugging Face en supprimant les abstractions

L'utilisateur pop123-ux a publié un référentiel d'apprentissage contenant 38 notebooks exécutables conçus pour aider les utilisateurs à comprendre la pile Hugging Face en supprimant progressivement les abstractions de haut niveau. La collection couvre un parcours allant des composants centraux comme transformers et tokenizers jusqu'au fine-tuning, PEFT, raisonnement/RL et au travail sur des projets de bout en bout.

media MarkTechPost · il y a 12 j Berkeley Function-Calling Leaderboard · 83.2% · 18 vues

Google Research publie ToolGrad, un cadre de génération de données pour l'utilisation d'outils

Des chercheurs de Google et de plusieurs universités japonaises ont présenté ToolGrad, un cadre qui inverse le pipeline traditionnel de génération de jeux de données pour l'utilisation d'outils en construisant d'abord des chaînes d'API vérifiées, puis en rédigeant les requêtes utilisateur correspondantes. Cette approche vise à éliminer l'inefficacité des méthodes axées sur la requête qui échouent souvent lors de l'exploration par les agents.

arxiv arXiv cs.CL · il y a 14 j SWE-bench Verified · 72.6% · 25 vues

ExecCritic utilise un RL spécifique au rôle pour améliorer les agents de codage via une réparation guidée par des tests

Les chercheurs présentent ExecCritic, un cadre qui combine un échafaudage de vérification-révision de tests avec un apprentissage par renforcement spécifique au rôle pour améliorer les agents de codage. Le système sépare la construction des tests de la réparation du code source, en utilisant un agent Test pour générer des tests natifs au dépôt et un agent Repair pour réviser le code sur la base des retours d'exécution.