Sujet · Training methods
arxiv arXiv cs.CL · il y a 16 h · 1 vue

Les modèles de langage contextuels gèrent le contexte nativement comme des fichiers modifiables

Des chercheurs présentent les Modèles de Langage Contextuels (CLM), une nouvelle architecture qui traite la fenêtre de contexte du modèle comme un fichier modifiable, permettant au modèle d'effectuer des mises à jour non restreintes de sa propre mémoire. Cette approche déplace la gestion du contexte du contrôle externe vers le comportement intrinsèque du modèle, permettant l'apprentissage en contexte et paramétrique des stratégies de gestion du contexte.

arxiv arXiv cs.CL · il y a 2 j SWE-bench Verified · 49.2% · 1 vue

ROFT améliore les modèles agents en affinant sur des explications auto-générées

Les chercheurs étudient le Retrospection-Only Fine-Tuning (ROFT), une procédure en ligne minimale où un agent génère des explications rétrospectives de ses propres expériences et est affiné en utilisant uniquement la perte de prédiction du prochain jeton sur ces jetons d'explication. Cette méthode ne nécessite ni enseignant externe ni mise à jour de politique basée sur la récompense.

arxiv arXiv cs.CL · il y a 7 j · 8 vues

VHD-Play génère des environnements RL agents à partir de mécanismes résolus

VHD-Play est un pipeline qui génère des environnements d'apprentissage par renforcement agents diversifiés en échantillonnant et résolvant des modèles mathématiques avant de rendre leurs processus décisionnels sous forme d'outils avec état. Cette approche garantit que les dynamiques exécutables et les références de score de trajectoire sont héritées directement du modèle résolu, adressant les problèmes de désalignement courants dans les pipelines de génération existants.

arxiv arXiv cs.CL · il y a 7 j SWE-Lancer · 51.47% · 10 vues

SkillGym intègre les compétences humaines dans les LLM pour la résolution de problèmes réels

Les chercheurs présentent SkillGym, un cadre qui transforme les compétences d'agents écrites par des humains en environnements d'entraînement exécutables et vérifiables pour des agents à grands modèles de langage. Le système utilise un pipeline compétence-tâche pour instancier des tâches concrètes et vérifier les résultats avec des contrôleurs basés sur du code.

lab Hugging Face Blog · il y a 7 j · 16 vues

NVIDIA Warp et MjWarp permettent la simulation robotique parallèle accélérée par GPU

MuJoCo Warp (MJWarp), construit sur NVIDIA Warp, permet aux modèles MuJoCo compatibles de s'exécuter à l'échelle du GPU, permettant le déploiement de centaines ou de milliers de mondes de simulation indépendants en un seul appel. Cette architecture déplace le focus de la minimisation de la latence pour un environnement unique vers l'amélioration du débit agrégé, ce qui favorise l'apprentissage par renforcement et l'échantillonnage à grande échelle.

arxiv arXiv cs.AI · il y a 8 j · 17 vues

Le Générateur d'État du Monde aligne les plans avec des mondes synthétiques pour améliorer le succès de l'agent

Le Générateur d'État du Monde (WSG) est un modèle qui maintient les plans des agents linguistiques alignés sur les règles de leur environnement d'exécution en réécrivant les états après des échecs. Il est entraîné sur 226K trajectoires extraites de sept domaines synthétiques où un programme applique des règles et vérifie l'atteignabilité de l'objectif.

arxiv arXiv cs.LG · il y a 9 j HealthBench · 50.1% · 13 vues

Fathom-Vaidya améliore le raisonnement médical avec des récompenses basées sur des grilles

Les auteurs présentent Fathom-Vaidya, un modèle de 30B paramètres qui utilise des données synthétiques et l'apprentissage par renforcement basé sur des grilles pour améliorer le raisonnement diagnostique et clinique en santé. Le cadre d'entraînement applique d'abord un RL guidé par des règles aux questions dérivées de MedBullets pour le diagnostic, puis utilise 5,3k scénarios synthétiques multi-tours avec des grilles multidimensionnelles pour les tâches cliniques interactives.

arxiv arXiv cs.AI · il y a 9 j HealthBench · 50.1% · 16 vues

Fathom-Vaidya améliore le raisonnement médical avec des récompenses basées sur des grilles

Les auteurs présentent Fathom-Vaidya, un modèle de 30B paramètres qui utilise des données synthétiques et l'apprentissage par renforcement basé sur des grilles pour améliorer à la fois le raisonnement diagnostique et clinique en santé. Le cadre d'entraînement cible d'abord la précision diagnostique en utilisant des questions dérivées de MedBullets, puis aborde les interactions cliniques multi-tours via 5,3k scénarios générés avec des grilles multidimensionnelles.

media Latent Space · il y a 9 j · 22 vues

TypeSafe AI présente Jev, un modèle System One entraîné par apprentissage par renforcement pour des décisions calibrées

TypeSafe AI a lancé Jev, une nouvelle classe de modèles « System One » conçue pour les environnements de production. Le PDG de l'entreprise et co-auteur de l'article sur InstructGPT, Diogo Almeida, soutient que les modèles de pointe actuels ont privilégié l'alignement et les refus au détriment de la fiabilité, ce qui entraîne des problèmes tels que les hallucinations et la complaisance.

media MarkTechPost · il y a 13 j · 23 vues

OpenAI publie un cadre de divulgation des désalignements de modèles avec 3 voies d'examen

OpenAI a présenté un nouveau cadre pour suivre, enquêter et divulguer les désalignements dans ses modèles, accompagné de six rapports détaillés sur des incidents liés à l'entraînement par apprentissage par renforcement. Le système établit des critères spécifiques et des délais pour la divulgation publique, s'appliquant même lorsque le comportement n'est pas entièrement expliqué ou atténué.

media Hugging Face Forums · il y a 14 j · 21 vues

ByteLex utilise la carte du tokeniser pour prédire et corriger les erreurs du modèle de bytes

Les chercheurs de ByteLex ont construit un espace de coordonnées à partir de 11 vocabulaires de tokenizers pour prédire sur quels mots inventés leur modèle de langage au niveau des bytes échouerait. La carte a obtenu une corrélation de Spearman de -0.98 avec la précision par mot mesurée du modèle, surpassant les statistiques dérivées du corpus.

arxiv arXiv cs.LG · il y a 15 j · 28 vues

OpenAI publie Open-1B avec un entraînement entièrement auditable

OpenAI a publié Open-1B, un modèle de langage entraîné selon un régime où chaque opération pendant l'entraînement est reproductible indépendamment sur du matériel hétérogène standard avec une certitude bit à bit. Cette approche traite des problèmes de reproductibilité inhérents aux modèles open-source en imposant un ordre défini aux sources de non-déterminisme, telles que les réductions de noyaux GPU et l'ordre des lots de données.