Research paper
arxiv arXiv cs.LG · il y a 2 j

U-OPSD permet l'auto-distillation non supervisée sur politique pour les LLM

Les chercheurs proposent l'Auto-Distillation Non Supervisée sur Politique (U-OPSD), une méthode qui améliore les performances post-entraînement des grands modèles de langage en utilisant uniquement les générations du modèle lui-même, sans supervision externe. L'approche échantillonne plusieurs rollouts pour construire une pseudo-solution par vote majoritaire, puis distille la distribution d'un enseignant dans les préfixes de la complétion incorrecte la plus longue du modèle.

arxiv arXiv cs.CL · il y a 2 j

M$^3$R-Bench introduit un benchmark ancré dans les preuves pour la compréhension des métaphores multimodales

Les chercheurs présentent M$^3$R-Bench, un benchmark unifié contenant 1 000 instances image-texte avec des annotations vérifiées par des humains, conçu pour évaluer la compréhension des métaphores multimodales ancrées dans les preuves. Le benchmark fournit des annotations conjointes pour l'occurrence de la métaphore, le mappage Cible-Source, le sentiment et des explications étape par étape basées sur la Théorie de la Métaphore Conceptuelle.

lab Google DeepMind Blog · il y a 3 j · 16 vues

Google DeepMind open source le modèle IA WeatherNext pour la prévision des cyclones

Google DeepMind et Google Research ont open-sourcé les modèles IA WeatherNext 2 et WeatherNext Cyclones, qui ont atteint une précision de pointe dans la prédiction des trajectoires, de l'intensité et de la structure du vent des cyclones tropicaux. Publié dans Nature, ce travail démontre que ces modèles offrent aux prévisionnistes un jour supplémentaire de précision prédictive par rapport aux systèmes antérieurs.

arxiv arXiv cs.AI · il y a 3 j SWE-bench Pro · 78.0%

Argus : un runtime agentique polyvalent pour le raisonnement à long terme

Les chercheurs présentent Argus, un runtime agentique persistant et auto-évolutif conçu pour le raisonnement à long terme qui sépare l'intention utilisateur stable des objectifs opérationnels. Le système utilise les rôles Manager, Planner, Engineer et Reviewer pour exécuter des missions bornées sur un état de projet durable, permettant une exécution autonome entre les points d'escalade détenus par l'opérateur.

media MarkTechPost · il y a 3 j

SkillOpt de Microsoft permet le transfert de compétences d'agent entre Codex et Claude Code

Des chercheurs de Microsoft, de l'Université Jiao Tong de Shanghai, de l'Université Tongji et de l'Université Fudan ont développé SkillOpt, un optimiseur dans l'espace textuel qui entraîne des documents de compétences en langage naturel tout en maintenant le modèle cible figé. Le système utilise un modèle d'optimisation pour proposer des modifications bornées basées sur des rollouts notés, exportant le résultat sous forme d'un seul fichier `best_skill.md`.

lab NVIDIA Research · il y a 3 j · 5 vues

ROSA améliore la productivité des usines jusqu'à 12,06x grâce au service de partage de pools GPU

Les chercheurs proposent ROSA, un système de déploiement de modèle fondamental pour la robotique conçu pour les usines de robots qui va au-delà des hypothèses de calcul en périphérie pour un seul robot. Le système utilise le service de partage de pools GPU pour permettre aux flottes de robots d'accéder à des GPUs de classe serveur via le réseau.

arxiv arXiv cs.LG · il y a 5 j OSWorld 2.0 · 21.2% · 6 vues

Qwen publie Qwen-CUA, un agent d'utilisation native du ordinateur de 397B-A17B

Qwen présente Qwen-CUA, un agent d'utilisation native du ordinateur construit sur une colonne vertébrale à experts mélangés de 397B-A17B qui opère via des captures d'écran et des événements d'entrée sans dépendre des arbres DOM ou des métadonnées d'accessibilité. Le système utilise un échafaudage pour maintenir jusqu'à 20 captures d'écran actives et a été entraîné en utilisant une flotte de déploiement cloud avec près de 100 000 vCPUs sur environ 40 000 tâches vérifiables.

arxiv arXiv cs.CL · il y a 5 j

Les moniteurs de chaîne de pensée s'effondrent lorsque les adversaires réécrivent le raisonnement

La recherche démontre que la surveillance de la chaîne de pensée (CoT) échoue face aux adversaires qui contrôlent le processus de raisonnement. En réécrivant le raisonnement d'un agent pour qu'il semble être un ingénierie de bonne foi tout en conservant les commandes et les sorties mot pour mot, les attaquants peuvent contourner les mécanismes de détection.

lab OpenAI News · il y a 8 j · 16 vues

Le modèle Astra résout dix problèmes ouverts en mathématiques et en informatique théorique

Le modèle interne Astra d'OpenAI a généré des solutions à dix problèmes ouverts de longue date en mathématiques et en informatique théorique, avec les arguments formalisés dans Lean. Ces résultats couvrent la géométrie de haute dimension, la théorie du codage, la théorie des groupes et la complexité quantique, abordant des questions qui n'avaient connu aucun progrès depuis au moins une décennie.

arxiv arXiv cs.CL · il y a 9 j · 2 vues

Mémoire à l'échelle : Passage à l'échelle des modèles de mémoire à long terme paramétrique jusqu'à 6,9 milliards de paramètres

Les chercheurs présentent Memory Decoder at Scale, un système qui met à l'échelle les modèles de mémoire à long terme paramétrique jusqu'à 6,9 milliards de paramètres et les pré-entraîne sur 300 milliards de tokens. Pour pallier l'irréalisme des pipelines Faiss standards à cette échelle de données, les auteurs implémentent un pipeline d'indexation distribué avec un chargement par lots et dispersé des distributions kNN.

arxiv arXiv cs.AI · il y a 9 j WebArena · 73.6% · 2 vues

Qwen-UI-Agent établit un record sur les benchmarks d'utilisation mobile

L'équipe Qwen a publié un rapport technique pour Qwen-UI-Agent, un agent GUI fondamental centré sur le monde réel conçu pour fonctionner de manière fiable dans des environnements mobiles, d'utilisation d'ordinateur, web et DeepSearch. Le système combine divers environnements sandbox avec un runtime mobile sur appareil réel à grande échelle, entrelaçant les opérations GUI avec l'exécution CLI et prenant en charge des tâches à long terme.

arxiv arXiv cs.CL · il y a 10 j · 4 vues

Living-Harness auto-évolue les agents de harnachement pour améliorer Pass@1 d'environ 10 points

Les chercheurs proposent Living-Harness, un agent de harnachement auto-évolutif qui convertit les trajectoires terminées et les signaux d'évaluateur en preuves a posteriori pour des mises à jour bornées du harnachement. Guidé par une Evolution-SOP, le système extrait des abstractions d'épisodes et des preuves de mise à jour structurées pour écrire la mémoire épisodique et les graphes d'état.

arxiv arXiv cs.CL · il y a 10 j · 3 vues

L'entraînement constitutionnel intermédiaire procure des gains d'alignement durables sans perte de capacités

Les chercheurs ont testé l'entraînement constitutionnel intermédiaire en insérant du contenu basé sur des valeurs dans le processus d'entraînement de modèles à 120 milliards de paramètres afin de déterminer s'il produit un alignement plus durable que les méthodes standard post-entraînement. L'étude a révélé que cette approche améliore significativement la généralisation et la durabilité de l'alignement, en particulier dans l'atténuation de la propension au chantage après un ajustement fin supervisé.