Source · arXiv cs.AI
arxiv arXiv cs.AI · il y a 2 j · 3 vues

SCOUT améliore le raisonnement spatial des VLM via un CoT structuré et un RL supervisé par processus

Les chercheurs proposent SCOUT, un cadre qui améliore le raisonnement spatial des Modèles Vision-Language en combinant une Chaîne de Pensée structurée avec un apprentissage par renforcement à récompense de processus multi-objectif. Cette approche traite les problèmes d'attribution de crédit dans les méthodes RL existantes et intègre la perception de la profondeur pour une compréhension 3D complète.

arxiv arXiv cs.AI · il y a 2 j HealthBench · 51.9% · 4 vues

Le RAG clinique VITA égale ou surpasse les grands modèles de langage de pointe sur HealthBench

Un système de génération augmentée par récupération conçu spécifiquement, nommé VITA, destiné aux contextes à revenu faible et intermédiaire, a été évalué face à des grands modèles de langage à usage général sur le benchmark HealthBench. L'étude démontre qu'une conception spécifique au corpus peut maintenir des performances compétitives même lorsque de nouveaux modèles de pointe sont publiés.

arxiv arXiv cs.AI · il y a 3 j

MiLMMT-46-v1.0 améliore la traduction multilingue grâce à un post-entraînement sans référence

Des chercheurs ont développé MiLMMT-46-v1.0, un modèle de traduction automatique multilingue qui applique un post-entraînement sans référence aux grands modèles de langage ouverts. L'équipe utilise l'optimisation de politique relative par groupe (GRPO) avec une récompense basée sur deux modèles d'estimation de la qualité sans référence, contrôlée par l'identification de la langue.

arxiv arXiv cs.AI · il y a 4 j

L'optimisation à finalité ouverte permet à GPT-5.5 de composer son propre processus d'amélioration

L'article présente l'Optimisation à Finalité Ouverte (OEO), un cadre qui permet à un optimiseur de modèle de pointe de composer dynamiquement son processus d'amélioration en ligne, plutôt que de s'appuyer sur des pipelines d'optimisation prédéfinis. Les auteurs comparent OEO à deux approches par étapes, SkillOpt et GEPA, à travers 14 comparaisons directes sur huit configurations de cible-benchmark-modèle.

arxiv arXiv cs.AI · il y a 4 j

AMIE (Video) atteint des performances de niveau expert dans les consultations médicales en temps réel

Les chercheurs ont démontré le premier système d'IA de niveau expert pour les consultations vidéo cliniques en temps réel utilisant AMIE (Video), un système multi-agents basé sur Gemini qui intègre un dialogue à faible latence avec une perception audiovisuelle en temps réel. Dans une étude randomisée d'examen clinique structuré objectif impliquant 30 médecins de premier recours et 100 scénarios, les évaluateurs cliniques ont jugé le système égal ou supérieur aux médecins pour la prise d'antécédents, le diagnostic, la prise en charge et l'observation physique.

arxiv arXiv cs.AI · il y a 4 j · 16 vues

Des attaquants volent des traces de raisonnement depuis les API de LLM propriétaires via une vulnérabilité de blocs chiffrés

Des chercheurs ont identifié une vulnérabilité architecturale dans la manière dont les principaux fournisseurs de grands modèles de langage gèrent les traces de raisonnement étape par étape. Les fournisseurs renvoient ces traces sous forme de blocs chiffrés aux clients, mais l'étude révèle que ces blocs sont entièrement compatibles et interchangeables entre différentes sessions, utilisateurs et modèles au sein de l'écosystème d'un fournisseur.

arxiv arXiv cs.AI · il y a 4 j OSWorld · 90.69% · 6 vues

L'agent auto-développant Ouroboros établit de nouveaux records avec Opus 5

Ouroboros est un cadre pour agents auto-développants où les outils, les prompts et l'implémentation centrale s'améliorent via des commits révisés qui deviennent le runtime pour le travail ultérieur. Il opère par évolution libre récursive ou évolution du noyau pilotée par l'expérience, déclenchée par des bugs et des inefficacités trouvés lors de l'utilisation.

arxiv arXiv cs.AI · il y a 4 j

Sangfor déploie SESG, un système de garde-fou de sécurité auto-évolutif

Sangfor a déployé SESG (Self-Evolving Safety Guardrails), un système multi-agents qui adapte en continu les défenses de sécurité des LLM face aux nouvelles menaces en production. Le système surveille le trafic en temps réel pour détecter les nouveaux jailbreaks et les catégories nuisibles, puis synthétise automatiquement les données d'entraînement et met à jour le modèle sans intervention manuelle.

arxiv arXiv cs.AI · il y a 5 j · 12 vues

GPT-5 et GPT-5 Nano égalent les experts dans l'évaluation de la recherche sur l'oncogenèse microbienne

Une étude démontre que GPT-5 et GPT-5 Nano atteignent un niveau de performance expert pour extraire des preuves et évaluer de manière critique des publications de recherche sur l'oncogenèse microbienne. Les chercheurs ont comparé ces modèles à Gemini 2.5 Pro et Gemini 2.5 Flash face à des experts du domaine, en utilisant un jeu de données de 24 articles centrés sur le MMTV-LV et le cancer du sein.

arxiv arXiv cs.AI · il y a 9 j SWE-bench Pro · 78.0% · 1 vue

Argus : un runtime agentique polyvalent pour le raisonnement à long terme

Les chercheurs présentent Argus, un runtime agentique persistant et auto-évolutif conçu pour le raisonnement à long terme qui sépare l'intention utilisateur stable des objectifs opérationnels. Le système utilise les rôles Manager, Planner, Engineer et Reviewer pour exécuter des missions bornées sur un état de projet durable, permettant une exécution autonome entre les points d'escalade détenus par l'opérateur.

arxiv arXiv cs.AI · il y a 9 j

SciCode-Verified corrige les défauts du benchmark pour révéler la véritable capacité de codage scientifique des modèles

Les auteurs identifient que les scores en plateau sur le benchmark SciCode proviennent de défauts significatifs dans l'instrument d'évaluation plutôt que de limitations dans la capacité des modèles. Un audit par des experts du domaine de 65 problèmes de test a révélé 263 défauts, dont 192 entraînant le rejet incorrect de solutions correctes en raison de problèmes tels que des réponses de référence non reproductibles et des tolérances excessivement serrées.

arxiv arXiv cs.AI · il y a 10 j

Video-DeepResearch présente un agent multimodal pour les flux vidéo continus

Les chercheurs présentent Video-DeepResearch (Video-DR), un cadre étendant les agents multimodaux des images statiques aux flux vidéo continus, en s'attaquant au biais de modalité et à la fuite de connaissances paramétriques. Le système utilise un pipeline de perception-exploration découplé avec un déverrouillage progressif des outils pour imposer l'ancrage visuel inter-images avant la récupération web.

arxiv arXiv cs.AI · il y a 15 j WebArena · 73.6% · 4 vues

Qwen-UI-Agent établit un record sur les benchmarks d'utilisation mobile

L'équipe Qwen a publié un rapport technique pour Qwen-UI-Agent, un agent GUI fondamental centré sur le monde réel conçu pour fonctionner de manière fiable dans des environnements mobiles, d'utilisation d'ordinateur, web et DeepSearch. Le système combine divers environnements sandbox avec un runtime mobile sur appareil réel à grande échelle, entrelaçant les opérations GUI avec l'exécution CLI et prenant en charge des tâches à long terme.

arxiv arXiv cs.AI · il y a 18 j · 1 vue

ClinFusion présente un MLLM centré sur la vision pour une compréhension médicale holistique

Les chercheurs présentent ClinFusion, un grand modèle de langage multimodal centré sur la vision conçu pour relever les défis du déploiement de l'IA dans la pratique clinique en unifiant la compréhension des images médicales 2D et 3D. Le système intègre un encodeur visuel en cascade compositionnel avec un opérateur de fusion de localité spatiale-aware en cascade et comprend un nouveau cadre d'évaluation composé de MedIF-Bench et de métriques ancrées sur la région d'intérêt.

arxiv arXiv cs.AI · il y a 18 j

Le module d'éligibilité Aethis utilise une architecture neuro-symbolique pour corriger les erreurs d'évaluation des règles LLM

L'article documente une classe de défaillance dans les grands modèles de langage de pointe appelée effondrement en chaîne d'exceptions, où les modèles évaluent incorrectement les règles conditionnelles imbriquées. Pour remédier à cela, les auteurs présentent le module d'éligibilité Aethis, une architecture neuro-symbolique qui combine des règles rédigées par un LLM avec une couche basée sur SMT pour une exécution déterministe.

arxiv arXiv cs.AI · il y a 22 j OSWorld · 37.7% · 5 vues

OpenForgeRL permet l'entraînement de bout en bout d'agents à base de harnais dans n'importe quel environnement

OpenForgeRL est un framework open-source qui permet aux chercheurs d'entraîner des agents IA à base de harnais de bout en bout en utilisant des piles standard de renforcement par apprentissage. Il y parvient en découplant l'entraînement de l'inférence grâce à un proxy léger qui enregistre les appels de modèle comme données et à un orchestrateur Kubernetes qui gère les déploiements de conteneurs distants.

arxiv arXiv cs.AI · il y a 22 j · 4 vues

AREX présente des agents de recherche profonde s'améliorant récursivement

Les chercheurs présentent AREX, une famille d'agents de recherche profonde Récursivement Auto-Améliorables (RSI) conçus pour résoudre l'asymétrie entre découverte et vérification dans les requêtes complexes. AREX alterne entre une boucle interne qui rassemble des preuves et construit des réponses provisoires, et une boucle externe qui audite les contraintes pour guider le raffinement ciblé.

arxiv arXiv cs.AI · il y a 23 j · 4 vues

SLAI T-Rex permet le post-entraînement à paramètres complets de DeepSeek-V4 sur Ascend SuperPOD

SLAI présente T-Rex, un framework d'optimisation de bout en bout pour le post-entraînement à paramètres complets de modèles MoE à l'échelle du trillion de paramètres sur Ascend NPU SuperPOD. En utilisant la famille de modèles DeepSeek-V4 comme charge de travail cible, le système adresse la pression mémoire et les frais de communication grâce à un parallélisme hiérarchique et des optimisations d'exécution de noyaux.