Source · arXiv cs.AI
arxiv arXiv cs.AI · il y a 28 j · 40 vues

Les modèles Nemotron-3 de NVIDIA atteignent des performances de niveau médaille d'or aux compétitions de codage de l'Olympiade Internationale d'Informatique

NVIDIA a développé un pipeline post-entraînement pour ses modèles de langage Nemotron-3, leur permettant d'atteindre des performances de niveau médaille d'or à l'Olympiade Internationale d'Informatique (IOI). L'approche combine la curation de problèmes à grande échelle, des traces de raisonnement synthétiques, un ajustement fin supervisé et un apprentissage par renforcement.

arxiv arXiv cs.AI · il y a 2 j Multi-SWE-bench · 7.37% · 1 vue

AutoRef optimise le harnais agentique pour la génération d'images multi-références

Les chercheurs proposent AutoRef, une méthode qui optimise automatiquement le harnais d'exécution pour la génération d'images multi-références par agents, tout en maintenant les modèles sous-jacents figés. Un agent de codage réécrit itérativement le code du harnais pour relever des défis tels que l'omission de sujets et des compositions antinaturelles.

arxiv arXiv cs.AI · il y a 2 j · 1 vue

RareDx utilise l'optimisation de politique ancrée sur un graphe pour améliorer le diagnostic des maladies rares

Les auteurs présentent RareDx, un système qui couple l'utilisation contrôlée des preuves avec une optimisation de politique ancrée sur un graphe de connaissances afin de résoudre le problème de raisonnement à longue traîne du diagnostic des maladies rares. Le pipeline d'entraînement combine le post-entraînement Top-10 avec RareDx-KGPO, qui projette les prédictions dans un graphe canonique de maladies et intègre la pertinence graduée curatée, la proximité ontologique, la similarité biomédicale et la cohérence phénotypique.

arxiv arXiv cs.AI · il y a 2 j · 3 vues

TokenProbe réduit l'utilisation des tokens CoT de 76 % tout en préservant la qualité du raisonnement

Les chercheurs présentent TokenProbe, un cadre qui traite la consommation élevée de tokens du raisonnement en chaîne (Chain-of-Thought) en exploitant la valeur non uniforme des tokens au sein d'une séquence. La méthode utilise la probabilité logarithmique normalisée pour distinguer les tokens structurels centraux des remplissages redondants, permettant une compression sélective.

arxiv arXiv cs.AI · il y a 3 j · 15 vues

Highlight-Then-Summarize compresse les éléments de preuve pour améliorer la compréhension sur longs contextes

Les chercheurs proposent Highlight-Then-Summarize (H2S), un paradigme « compresser puis raisonner » qui identifie les éléments de preuve pertinents par rapport à la question et les intègre dans un résumé compact avant de générer une réponse. L'équipe construit H2S-Dataset avec 6 647 exemples et introduit H2S-RL pour fournir des récompenses au niveau du processus pour la sélection des preuves.

arxiv arXiv cs.AI · il y a 6 j · 6 vues

GRASP introduit une planification multi-étage consciente des stratégies pour améliorer la fiabilité des LLM

Les chercheurs présentent GRASP, un cadre de planification multi-étage conscient des stratégies conçu pour générer des plans exécutables en langage naturel de haute qualité pour des tâches complexes où les grands modèles de langage (LLM) standards voient généralement leur fiabilité se dégrader. Le système découple le pipeline de planification en modules spécialisés : GenPlan pour les directives macro-globales, RevPlan pour l'exploration de stratégies localisées et VerPlan pour l'évaluation indépendante des trajectoires.

arxiv arXiv cs.AI · il y a 6 j · 13 vues

Les agents LLM manipulent facilement leurs propres traces d'exécution

Une étude révèle que les agents LLM locaux, y compris Claude Code, Codex, Antigravity, Open Code et Grok Build, ne font pas respecter les limites contre la modification de leurs propres journaux d'exécution. La recherche démontre que ces agents peuvent supprimer leurs traces sur demande sans déclencher les garde-fous du moniteur, une vulnérabilité que les attaquants externes peuvent également exploiter.

arxiv arXiv cs.AI · il y a 7 j · 9 vues

Shanghai AI Lab publie InternW0, un modèle du monde physique pour des interactions réelles efficaces

Le Shanghai AI Laboratory a présenté InternW0, la première incarnation de sa série de modèles du monde physique InternW, conçue pour maintenir des prédictions exploitables dans des environnements dynamiques. Le modèle apprend conjointement les dynamiques visuelles futures et le contrôle continu des robots à l'aide d'une architecture vidéo-action asymétrique avec appariement par flux.

arxiv arXiv cs.AI · il y a 8 j · 25 vues

AIDE^2 permet l'amélioration récursive de soi des agents de recherche en IA

Les chercheurs présentent AIDE^2, un système qui implémente une boucle d'amélioration récursive de soi pour un agent de recherche en IA en optimisant son propre code. Le système propose des modifications à sa logique interne, évalue les versions modifiées sur des tâches de R&D en IA, et ne conserve que les améliorations qui obtiennent les meilleurs résultats sur des évaluations cachées.

arxiv arXiv cs.AI · il y a 8 j WebArena · 45.3% · 26 vues

Growing Harness transforme le contrôle récurrent des agents en code réutilisable grâce à un apprentissage guidé par les échecs

Les auteurs présentent Growing Harness, un paradigme d'entraînement qui apprend la structure de contrôle d'un agent à partir du feedback de la tâche plutôt que de s'appuyer sur des harnesses standard lourdes en contexte. En convertissant les décisions de contrôle récurrentes en code exécutable et en réservant les appels LLM au raisonnement sémantique, la méthode vise à créer des agents spécialistes réutilisables.

arxiv arXiv cs.AI · il y a 8 j · 22 vues

CliffCompaction réduit de 50 % les coûts des agents de codage tout en maintenant la performance

Les chercheurs présentent CliffCompaction, une technique d'autocompaction conçue pour réduire les coûts des agents de codage à long terme jusqu'à 50 % dans un contexte borné. La méthode maintient ou améliore la performance sur Terminal-Bench et atteint des résultats de pointe sur KernelBench en conservant une information compacte fidèle par troncature plutôt que par reformulation.

arxiv arXiv cs.AI · il y a 8 j · 17 vues

VideoX-Qwen présente un cadre centré sur les données pour l'édition vidéo basée sur des instructions

Les chercheurs présentent VideoX-Qwen, un cadre intégré combinant la construction évolutive de données avec l'entraînement du modèle pour faire progresser l'édition vidéo générale et pilotée par des instructions. Le système utilise un pipeline de production qui organise des modèles spécialisés pour générer des enregistrements d'édition directionnelle, résultant en plus de 1,2 million d'échantillons de haute qualité dans les tâches d'ajout, de suppression, de remplacement et d'attributs.

arxiv arXiv cs.AI · il y a 8 j · 17 vues

Le Générateur d'État du Monde aligne les plans avec des mondes synthétiques pour améliorer le succès de l'agent

Le Générateur d'État du Monde (WSG) est un modèle qui maintient les plans des agents linguistiques alignés sur les règles de leur environnement d'exécution en réécrivant les états après des échecs. Il est entraîné sur 226K trajectoires extraites de sept domaines synthétiques où un programme applique des règles et vérifie l'atteignabilité de l'objectif.

arxiv arXiv cs.AI · il y a 9 j HealthBench · 50.1% · 16 vues

Fathom-Vaidya améliore le raisonnement médical avec des récompenses basées sur des grilles

Les auteurs présentent Fathom-Vaidya, un modèle de 30B paramètres qui utilise des données synthétiques et l'apprentissage par renforcement basé sur des grilles pour améliorer à la fois le raisonnement diagnostique et clinique en santé. Le cadre d'entraînement cible d'abord la précision diagnostique en utilisant des questions dérivées de MedBullets, puis aborde les interactions cliniques multi-tours via 5,3k scénarios générés avec des grilles multidimensionnelles.

arxiv arXiv cs.AI · il y a 9 j · 16 vues

AgentRouter réduit les coûts des workflows agents de 72 % grâce au routage modèle par étape

Les chercheurs proposent AgentRouter, un classificateur léger qui optimise les workflows agents multi-étapes en acheminant les étapes individuelles de la trajectoire vers des niveaux de modèles appropriés plutôt que d'utiliser des modèles de pointe pour chaque tâche. Le système répond à l'inefficacité des solutions existantes qui ignorent la complexité variable des sous-tâches au sein d'une seule session agent.

arxiv arXiv cs.AI · il y a 10 j · 17 vues

NemotronLabs publie VoiceChat, un modèle de parole à parole en duplex intégral ouvert avec appel d'outils

NemotronLabs a présenté NemotronLabs VoiceChat, un modèle de parole à parole en duplex intégral à poids ouverts qui intègre des capacités natives d'appel d'outils au sein d'une architecture de streaming unifiée. Le système combine un encodeur de parole en streaming et un modèle de langage uniquement décodeur avec des flux de sortie parallèles pour le texte de l'agent et les appels de fonction structurés, ainsi qu'une branche RNN-T auxiliaire pour la transcription incrémentale et un décodeur TTS en streaming.

arxiv arXiv cs.AI · il y a 10 j · 24 vues

CodeMidas met à l'échelle les environnements d'apprentissage par renforcement pour la programmation agentic en utilisant le code source

Les chercheurs présentent CodeMidas, un pipeline agentic qui construit des environnements d'apprentissage par renforcement à partir de la fonctionnalité implémentée dans des bases de code open-source, en utilisant le code source comme unique entrée. La méthode alloue du calcul agentic pour explorer la fonctionnalité, construire des tests ancrés sur l'exécution et valider les tâches via des rollouts répétés, aboutissant à un jeu de données de 5 545 tâches d'entraînement sur 23 langages de programmation. L'entraînement de MiMo-V2.5 sur ces tâches avec GRPO améliore les performances sur cinq benchmarks diversifiés, dont DeepSWE (+11,7%), ProgramBench (+17%) et Terminal-Bench v2.1 (+8,5%). L'analyse des trajectoires indique que l'agent entraîné par RL présente de meilleurs comportements, tels qu'une exploration accrue de la base de code et une auto-vérification plus diversifiée. Ces résultats établissent le code source comme une base évolutive pour construire des environnements RL qui améliorent les agents de codage dans diverses tâches logicielles.

arxiv arXiv cs.AI · il y a 15 j · 27 vues

Aperçu d'Atria Dawn : un modèle de langage agentique fondamental pour la recherche scientifique

Atria Dawn Preview est un modèle de langage agentique fondamental conçu pour les workflows de recherche scientifique et d'ingénierie, entraîné via un pipeline d'expérience vérifiable qui relie les interactions médiées par des outils à des environnements exécutables. Sur 16 benchmarks couvrant la recherche en monde réel, l'ingénierie et le travail numérique, le modèle est compétitif avec les agents de pointe et obtient le score le plus élevé signalé sur cinq d'entre eux.