Source · arXiv cs.CL
arxiv arXiv cs.CL · il y a 28 j · 35 vues

Les modèles NVIDIA Nemotron-3 atteignent des performances de médaille d'or aux compétitions de codage de l'IOI

NVIDIA a développé des pipelines de post-apprentissage pour ses modèles de langage Nemotron-3-Nano-CC et Nemotron-3-Ultra-CC afin d'exceller en programmation concurrentielle. En combinant la curation à grande échelle de problèmes, des traces de raisonnement synthétiques, un ajustement fin supervisé (SFT) et l'apprentissage par renforcement, l'équipe a créé des systèmes spécialisés capables de raisonnement algorithmique de haut niveau.

arxiv arXiv cs.CL · il y a 16 h · 1 vue

Les modèles de langage contextuels gèrent le contexte nativement comme des fichiers modifiables

Des chercheurs présentent les Modèles de Langage Contextuels (CLM), une nouvelle architecture qui traite la fenêtre de contexte du modèle comme un fichier modifiable, permettant au modèle d'effectuer des mises à jour non restreintes de sa propre mémoire. Cette approche déplace la gestion du contexte du contrôle externe vers le comportement intrinsèque du modèle, permettant l'apprentissage en contexte et paramétrique des stratégies de gestion du contexte.

arxiv arXiv cs.CL · il y a 2 j · 1 vue

Une étude révèle une divergence des politiques épistémiques dans la contamination des LLM multi-tours

Une étude intitulée « Divergence des politiques épistémiques dans la contamination des LLM multi-tours : Une investigation par gradient de protocole » évalue comment les grands modèles de langage gèrent les prémisses fausses injectées dans l'historique de conversation, un mode d'échec appelé contamination au niveau de la session. Les chercheurs ont testé GPT-5.4 Mini, Gemini-3.1 Flash-Lite et GLM-4.5-Air sur dix domaines de connaissances en utilisant 22 500 tours à température nulle.

arxiv arXiv cs.CL · il y a 2 j SWE-bench Verified · 49.2% · 1 vue

ROFT améliore les modèles agents en affinant sur des explications auto-générées

Les chercheurs étudient le Retrospection-Only Fine-Tuning (ROFT), une procédure en ligne minimale où un agent génère des explications rétrospectives de ses propres expériences et est affiné en utilisant uniquement la perte de prédiction du prochain jeton sur ces jetons d'explication. Cette méthode ne nécessite ni enseignant externe ni mise à jour de politique basée sur la récompense.

arxiv arXiv cs.CL · il y a 2 j · 1 vue

TokenProbe réduit l'utilisation des tokens CoT de 76 % tout en préservant la précision

Les chercheurs présentent TokenProbe, un cadre qui traite la forte consommation de tokens du raisonnement Chain-of-Thought en exploitant la valeur non uniforme des tokens au sein des traces de raisonnement. La méthode distingue les tokens centraux portant le contenu décisif des remplissages redondants à l'aide de signaux de probabilité logarithmique normalisée.

arxiv arXiv cs.CL · il y a 2 j · 1 vue

Rep2Act aligne les représentations des VLM pour améliorer l'abstention sur le nouveau benchmark VAD-R

Les chercheurs présentent Visual Answerability Diagnosis with Rationales (VAD-R), un nouveau benchmark conçu pour évaluer la capacité des modèles vision-langage à s'abstenir de répondre aux questions sans réponse, sans se fier à des indices de raccourci. L'étude révèle que si les états cachés peuvent distinguer l'accessibilité de la réponse, les modèles actuels échuent à traduire cela en décisions explicites.

arxiv arXiv cs.CL · il y a 3 j · 6 vues

Highlight-Then-Summarize compresse les preuves pour une meilleure compréhension des contextes longs

Les chercheurs proposent Highlight-Then-Summarize (H2S), un paradigme de compression puis raisonnement qui identifie les preuves pertinentes à la question et les intègre dans un résumé compact avant de générer une réponse. Pour soutenir cette approche, l'équipe a construit H2S-Dataset avec 6 647 exemples provenant de 11 familles de benchmarks et a introduit H2S-RL pour des récompenses au niveau du processus.

arxiv arXiv cs.CL · il y a 3 j · 7 vues

KuaFu compresse le comportement utilisateur en compréhension à l'échelle du milliard

Tencent présente KuaFu, une couche unifiée de compression du comportement qui condense l'historique brut de l'utilisateur en représentations compactes pour les agents conversationnels et les recommandeurs. Le système utilise un projecteur à deux axes pour compresser chaque élément de comportement en 2-4 tokens de largeur 128-256, adressant les goulots d'étranglement dans le traitement des séquences longues pour un milliard d'utilisateurs.

arxiv arXiv cs.CL · il y a 6 j · 9 vues

Le harnais de pont de coroutine remporte la Piste 2 de CAR-bench avec un Pass^3 de 60,0 %

Un nouveau harnais de pont de coroutine pour les agents utilisant des outils a remporté la Piste 2 de l'évaluation CAR-bench, atteignant un score de Pass@3 de 60,0 % sur l'ensemble de test caché officiel. Le système découple l'appel du modèle des allers-retours d'outils en faisant émettre au modèle des programmes Python qui bloquent et reprennent l'exécution à travers les échanges avec l'évaluateur.

arxiv arXiv cs.CL · il y a 7 j · 8 vues

VHD-Play génère des environnements RL agents à partir de mécanismes résolus

VHD-Play est un pipeline qui génère des environnements d'apprentissage par renforcement agents diversifiés en échantillonnant et résolvant des modèles mathématiques avant de rendre leurs processus décisionnels sous forme d'outils avec état. Cette approche garantit que les dynamiques exécutables et les références de score de trajectoire sont héritées directement du modèle résolu, adressant les problèmes de désalignement courants dans les pipelines de génération existants.

arxiv arXiv cs.CL · il y a 7 j · 2 vues

Le benchmark WebMRE révèle le renforcement mutuel guide-action dans les agents web

Les auteurs présentent WebMRE, un benchmark hors ligne de 541 tâches et 5 293 étapes dérivés de trajectoires WebArena réussies, conçu pour fournir un protocole déterministe d'évaluation des points de contrôle des agents web sans dérive de l'environnement. Ce cadre associe des phrases-guide orientées humain à des actions ancrées afin d'étudier l'effet de renforcement mutuel entre elles.

arxiv arXiv cs.CL · il y a 7 j SWE-Lancer · 51.47% · 10 vues

SkillGym intègre les compétences humaines dans les LLM pour la résolution de problèmes réels

Les chercheurs présentent SkillGym, un cadre qui transforme les compétences d'agents écrites par des humains en environnements d'entraînement exécutables et vérifiables pour des agents à grands modèles de langage. Le système utilise un pipeline compétence-tâche pour instancier des tâches concrètes et vérifier les résultats avec des contrôleurs basés sur du code.

arxiv arXiv cs.CL · il y a 8 j · 19 vues

TelecomGPT-R1 : Post-apprentissage unifié pour le raisonnement sur des tâches télécom hétérogènes

Les chercheurs présentent TelecomGPT-R1, une famille de modèles de raisonnement télécom unifiés et open-source conçus pour automatiser les tâches d'ingénierie en raisonnant sur les normes, les configurations et les journaux. Le modèle comble les lacunes des LLM généralistes et spécialisés existants grâce à une approche structurée couvrant les axes du protocole, des connaissances, de la modélisation et des pannes.

arxiv arXiv cs.CL · il y a 9 j · 15 vues

AgentRouter réduit les coûts des workflows agents de 72 % grâce au routage modèle par étape

Les chercheurs proposent AgentRouter, un classificateur léger qui optimise les workflows agents multi-étapes en acheminant les étapes individuelles des trajectoires vers des niveaux de modèles appropriés plutôt que d'utiliser un seul modèle de pointe pour toutes les tâches. Le système répond à l'inefficacité des systèmes d'entreprise qui gaspillent 60 à 80 % de leur budget d'inférence sur des sous-tâches que des modèles plus petits peuvent traiter aussi bien.

arxiv arXiv cs.CL · il y a 10 j · 17 vues

NemotronLabs publie VoiceChat, un modèle de parole en parole plein duplex ouvert avec appel d'outils

NemotronLabs a présenté VoiceChat, un modèle poids ouverts de parole en parole plein duplex conçu pour intégrer l'écoute, la transcription, le raisonnement et la parole au sein d'une architecture de streaming unifiée. Le système combine un encodeur de flux audio et un décodeur de modèle de langage avec des flux de sortie spécialisés parallèles pour le texte agent et les appels de fonction structurés, ainsi qu'une branche RNN-T auxiliaire pour la transcription incrémentale de l'utilisateur.