Source · arXiv cs.LG
arxiv arXiv cs.LG · il y a 28 j · 73 vues

Les modèles Nemotron-3 de NVIDIA atteignent des scores médaille d'or et supérieurs aux meilleurs humains à l'OII 2026

Des chercheurs ont développé un pipeline post-entraînement pour les grands modèles de langage qui leur permet d'atteindre des performances médaille d'or en programmation compétitive. En combinant le réglage fin supervisé, l'apprentissage par renforcement et une nouvelle stratégie pilotée par les feedbacks appelée GenCorrect, le système surpasse les meilleurs participants humains sur l'ensemble de problèmes de l'OII 2026.

arxiv arXiv cs.LG · il y a 6 j · 7 vues

Le cadre GRASP améliore la planification stratégique grâce à l'IA agentique multi-étapes

Les chercheurs présentent GRASP, un cadre de planification multi-étapes conscient des stratégies, conçu pour générer des plans exécutables en langage naturel de haute qualité pour des tâches complexes en découplant le pipeline en modules spécialisés. Le système pré-compile des directives macro-globales via GenPlan, explore des stratégies localisées par l'intermédiaire de RevPlan et évalue les trajectoires à l'aide d'un discriminateur multi-critères appelé VerPlan.

arxiv arXiv cs.LG · il y a 8 j · 22 vues

AIDE^2 permet l'amélioration récursive de soi des agents de recherche en IA

Les chercheurs présentent AIDE^2, un système qui met en œuvre une boucle d'amélioration récursive de soi pour un agent de recherche en IA de pointe en optimisant son propre code. Le système propose des modifications à sa logique interne, évalue les versions modifiées sur des tâches de R&D en IA, et ne conserve que les mises à jour qui obtiennent les meilleurs résultats sur des évaluations cachées.

arxiv arXiv cs.LG · il y a 8 j · 21 vues

CliffCompaction réduit les coûts des agents de codage à long terme jusqu'à 50 % tout en maintenant les performances

Les chercheurs présentent CliffCompaction, une technique d'autocompaction conçue pour les agents traitant des millions de tokens, qui réduit les coûts jusqu'à 50 % dans un contexte borné. La méthode maintient ou améliore les performances sur Terminal-Bench et atteint des résultats de pointe sur KernelBench en conservant la fidélité de l'information par troncature plutôt que par reformulation.

arxiv arXiv cs.LG · il y a 9 j HealthBench · 50.1% · 13 vues

Fathom-Vaidya améliore le raisonnement médical avec des récompenses basées sur des grilles

Les auteurs présentent Fathom-Vaidya, un modèle de 30B paramètres qui utilise des données synthétiques et l'apprentissage par renforcement basé sur des grilles pour améliorer le raisonnement diagnostique et clinique en santé. Le cadre d'entraînement applique d'abord un RL guidé par des règles aux questions dérivées de MedBullets pour le diagnostic, puis utilise 5,3k scénarios synthétiques multi-tours avec des grilles multidimensionnelles pour les tâches cliniques interactives.

arxiv arXiv cs.LG · il y a 15 j · 28 vues

OpenAI publie Open-1B avec un entraînement entièrement auditable

OpenAI a publié Open-1B, un modèle de langage entraîné selon un régime où chaque opération pendant l'entraînement est reproductible indépendamment sur du matériel hétérogène standard avec une certitude bit à bit. Cette approche traite des problèmes de reproductibilité inhérents aux modèles open-source en imposant un ordre défini aux sources de non-déterminisme, telles que les réductions de noyaux GPU et l'ordre des lots de données.

arxiv arXiv cs.LG · il y a 16 j Codeforces (Elo) · 98.2% · 29 vues

Stellar Colosseum : un harnais multi-agents pour la recherche en mathématiques et en informatique théorique sur le long terme

Les auteurs présentent Stellar Colosseum, un harnais agnostique aux modèles conçu pour répartir l'inférence dans la recherche à long terme en mathématiques et en informatique théorique. Le système explore des stratégies alternatives avant la construction de la preuve, utilise une porte d'état prêt pour déterminer quand une voie est suffisamment mature pour la décomposition, et représente le plan de preuve comme un ensemble de sous-problèmes interdépendants au niveau des sections.

arxiv arXiv cs.LG · il y a 24 j · 33 vues

La méthode d'incertitude spéculative réduit les erreurs des agents en ingénierie logicielle grâce au filtrage par modèle de brouillon

Les auteurs présentent l'Incertitude Spéculative (SU), une technique qui récupère un signal d'échec prédictif pour les agents LLM à boîte noire en analysant uniquement leurs tokens de sortie, sans nécessiter d'accès aux logits, aux poids ou aux activations. En inversant le décodage spéculatif, un petit modèle de brouillon à poids ouvert évalue la trajectoire de l'agent lors d'un seul passage avant pour extraire des caractéristiques sensibles à la phase et les calibrer par rapport à un objectif vérifiable.

arxiv arXiv cs.LG · il y a 27 j · 51 vues

FlashAttention-4 introduit Direct-P pour l'inférence et l'entraînement FP4 sensibles au matériel

FlashAttention-4 comble les limitations de performance des cœurs tensoriels 4 bits (FP4) de Blackwell en introduisant de nouveaux chemins pour l'inférence non causale et l'entraînement causal. La méthode, appelée Direct-P, mappe directement les scores aux probabilités FP4 afin de contourner les surcoûts de conversion softmax qui dominent généralement lorsque les produits matriciels diminuent.

arxiv arXiv cs.LG · il y a 29 j SWE-bench Verified · 16.6% · 42 vues

CANOPY permet à Qwen3-14B de dominer AppWorld grâce au RL uniquement basé sur le résultat

L'article présente CANOPY (Coverage-ANchored On-PolicY RL), un protocole qui traite la famine de signaux et la dérive de politique dans l'apprentissage par renforcement à long terme pour les petits modèles ouverts. En amplifiant l'exploration sur la même tâche et en maintenant les mises à jour ancrées par KL, la méthode permet aux agents d'apprendre efficacement uniquement grâce à la vérification en fin de tâche.