Research paper
arxiv arXiv cs.AI · il y a 2 h · 9 vues

AIDE^2 permet l'amélioration récursive de soi des agents de recherche en IA

Les chercheurs présentent AIDE^2, un système qui implémente une boucle d'amélioration récursive de soi pour un agent de recherche en IA en optimisant son propre code. Le système propose des modifications à sa logique interne, évalue les versions modifiées sur des tâches de R&D en IA, et ne conserve que les améliorations qui obtiennent les meilleurs résultats sur des évaluations cachées.

arxiv arXiv cs.AI · il y a 3 h WebArena · 45.3% · 13 vues

Growing Harness transforme le contrôle récurrent des agents en code réutilisable grâce à un apprentissage guidé par les échecs

Les auteurs présentent Growing Harness, un paradigme d'entraînement qui apprend la structure de contrôle d'un agent à partir du feedback de la tâche plutôt que de s'appuyer sur des harnesses standard lourdes en contexte. En convertissant les décisions de contrôle récurrentes en code exécutable et en réservant les appels LLM au raisonnement sémantique, la méthode vise à créer des agents spécialistes réutilisables.

arxiv arXiv cs.LG · il y a 4 h · 11 vues

AIDE^2 permet l'amélioration récursive de soi des agents de recherche en IA

Les chercheurs présentent AIDE^2, un système qui met en œuvre une boucle d'amélioration récursive de soi pour un agent de recherche en IA de pointe en optimisant son propre code. Le système propose des modifications à sa logique interne, évalue les versions modifiées sur des tâches de R&D en IA, et ne conserve que les mises à jour qui obtiennent les meilleurs résultats sur des évaluations cachées.

arxiv arXiv cs.CL · il y a 7 h · 11 vues

TelecomGPT-R1 : Post-apprentissage unifié pour le raisonnement sur des tâches télécom hétérogènes

Les chercheurs présentent TelecomGPT-R1, une famille de modèles de raisonnement télécom unifiés et open-source conçus pour automatiser les tâches d'ingénierie en raisonnant sur les normes, les configurations et les journaux. Le modèle comble les lacunes des LLM généralistes et spécialisés existants grâce à une approche structurée couvrant les axes du protocole, des connaissances, de la modélisation et des pannes.

arxiv arXiv cs.LG · il y a 1 j HealthBench · 50.1% · 10 vues

Fathom-Vaidya améliore le raisonnement médical avec des récompenses basées sur des grilles

Les auteurs présentent Fathom-Vaidya, un modèle de 30B paramètres qui utilise des données synthétiques et l'apprentissage par renforcement basé sur des grilles pour améliorer le raisonnement diagnostique et clinique en santé. Le cadre d'entraînement applique d'abord un RL guidé par des règles aux questions dérivées de MedBullets pour le diagnostic, puis utilise 5,3k scénarios synthétiques multi-tours avec des grilles multidimensionnelles pour les tâches cliniques interactives.

arxiv arXiv cs.AI · il y a 1 j HealthBench · 50.1% · 12 vues

Fathom-Vaidya améliore le raisonnement médical avec des récompenses basées sur des grilles

Les auteurs présentent Fathom-Vaidya, un modèle de 30B paramètres qui utilise des données synthétiques et l'apprentissage par renforcement basé sur des grilles pour améliorer à la fois le raisonnement diagnostique et clinique en santé. Le cadre d'entraînement cible d'abord la précision diagnostique en utilisant des questions dérivées de MedBullets, puis aborde les interactions cliniques multi-tours via 5,3k scénarios générés avec des grilles multidimensionnelles.

lab Microsoft Research Blog · il y a 2 j · 29 vues

Microsoft publie RetroChimera pour la prédiction de rétrosynthèse

Microsoft Research a publié et open-sourcé RetroChimera, un nouveau cadre de prédiction de rétrosynthèse qui combine deux modèles complémentaires pour proposer des voies de synthèse de haute qualité. Le système intègre R-SMILES 2, un modèle de novo basé sur Transformer, avec NeuralLoc, un modèle basé sur un réseau neuronal graphique (GNN), en utilisant une stratégie d'assemblage apprise pour classer les prédictions.

arxiv arXiv cs.AI · il y a 2 j · 18 vues

CodeMidas met à l'échelle les environnements d'apprentissage par renforcement pour la programmation agentic en utilisant le code source

Les chercheurs présentent CodeMidas, un pipeline agentic qui construit des environnements d'apprentissage par renforcement à partir de la fonctionnalité implémentée dans des bases de code open-source, en utilisant le code source comme unique entrée. La méthode alloue du calcul agentic pour explorer la fonctionnalité, construire des tests ancrés sur l'exécution et valider les tâches via des rollouts répétés, aboutissant à un jeu de données de 5 545 tâches d'entraînement sur 23 langages de programmation. L'entraînement de MiMo-V2.5 sur ces tâches avec GRPO améliore les performances sur cinq benchmarks diversifiés, dont DeepSWE (+11,7%), ProgramBench (+17%) et Terminal-Bench v2.1 (+8,5%). L'analyse des trajectoires indique que l'agent entraîné par RL présente de meilleurs comportements, tels qu'une exploration accrue de la base de code et une auto-vérification plus diversifiée. Ces résultats établissent le code source comme une base évolutive pour construire des environnements RL qui améliorent les agents de codage dans diverses tâches logicielles.

arxiv arXiv cs.CL · il y a 2 j · 10 vues

TrialAtlas : un système multi-agents améliore l'évaluation des risques de conception d'essais cliniques

Des chercheurs ont présenté TrialAtlas, une organisation de recherche multi-agents enrichie par la mémoire, conçue pour assister la planification du développement clinique (CDP). Le système coordonne des agents spécialisés dans la synthèse de la littérature, l'intelligence concurrentielle et l'analyse réglementaire afin d'anticiper les risques de développement.

media Hugging Face Forums · il y a 3 j · 16 vues

Un chercheur sollicite un seul annotateur indépendant pour lever l'ambiguïté de l'accord des LLM

Un chercheur demande à un seul annotateur humain indépendant d'étiqueter 100 scènes narratives turques afin de déterminer si le faible accord inter-évaluateurs provient du caractère interprétatif de la tâche ou de définitions d'annotation mal précisées. L'étude a révélé que quatre LLM et un détecteur basé sur des règles étaient en accord entre eux et avec la référence humaine à un niveau proche du hasard, les scores de κ de Cohen variant de 0,000 à 0,185.

media Hugging Face Forums · il y a 3 j · 17 vues

GlucoEdge : prévision des tendances glycémiques sur l'appareil avec quantification INT8

Le chercheur indépendant Mohamed Menasy a publié GlucoEdge, une étude d'ingénierie détaillant un pipeline de machine learning sur l'appareil de bout en bout pour la prévision des tendances glycémiques sur cinq classes et 15 minutes à partir de données de moniteur continu de glucose. Le travail introduit un CNN 1D compact ne contenant que 2 909 paramètres et couvre l'ensemble du workflow, de PyTorch à la conversion LiteRT.

arxiv arXiv cs.LG · il y a 7 j · 20 vues

OpenAI publie Open-1B avec un entraînement entièrement auditable

OpenAI a publié Open-1B, un modèle de langage entraîné selon un régime où chaque opération pendant l'entraînement est reproductible indépendamment sur du matériel hétérogène standard avec une certitude bit à bit. Cette approche traite des problèmes de reproductibilité inhérents aux modèles open-source en imposant un ordre défini aux sources de non-déterminisme, telles que les réductions de noyaux GPU et l'ordre des lots de données.

arxiv arXiv cs.AI · il y a 8 j · 24 vues

Aperçu d'Atria Dawn : un modèle de langage agentique fondamental pour la recherche scientifique

Atria Dawn Preview est un modèle de langage agentique fondamental conçu pour les workflows de recherche scientifique et d'ingénierie, entraîné via un pipeline d'expérience vérifiable qui relie les interactions médiées par des outils à des environnements exécutables. Sur 16 benchmarks couvrant la recherche en monde réel, l'ingénierie et le travail numérique, le modèle est compétitif avec les agents de pointe et obtient le score le plus élevé signalé sur cinq d'entre eux.