Source · arXiv cs.CL
arxiv arXiv cs.CL · il y a 23 h

Multiplication matricielle réduite : réduction adaptative au niveau de l'entrée pour l'inférence des LLM

Les chercheurs proposent la Multiplication Matricielle Réduite (RMM), une méthode d'inférence sans entraînement et adaptative à l'entrée, qui réduit les produits matriciels des Transformers en sélectionnant des tranches informatives le long des dimensions de contraction, sans modifier les poids du modèle. Sous un contrôle simple du ratio de rétention, RMM offre un compromis précision-efficacité fluide et prévisible pour des modèles linguistiques allant de 1B à 70B paramètres.

arxiv arXiv cs.CL · il y a 23 h

AutoDesign utilise l'optimisation par méta-harnais pour améliorer la conception à long terme des agents

L'article présente AutoDesign, un cadre qui emploie un optimiseur de méta-harnais pour guider un agent de code dans l'amélioration récursive de son harnais en fonction du feedback des rollouts. Les auteurs évaluent cette approche sur la tâche de génération d'affiche à partir d'un article académique en utilisant un nouveau benchmark appelé PosterBench.

arxiv arXiv cs.CL · il y a 1 j

Intern-S2-Preview présente un modèle fondamental scientifique agentique avec pré-entraînement multimodal et RL

Les auteurs présentent Intern-S2-Preview, une série de modèles fondamentaux scientifiques agentiques conçus pour soutenir la compréhension scientifique multimodale, le raisonnement, la génération et les tâches à long terme. Le pipeline d'entraînement commence par un pré-entraînement multimodal scientifique sur des documents scientifiques rendus, des données image-texte entrelacées et divers corpus scientifiques.

arxiv arXiv cs.CL · il y a 3 j · 1 vue

MiLMMT-46-v1.0 améliore la traduction multilingue grâce à un post-apprentissage sans référence

Les chercheurs ont publié MiLMMT-46-v1.0, un grand modèle de langage ouvert pour la traduction automatique multilingue qui utilise un post-apprentissage sans référence. À partir du MiLMMT-46-v0.1 finement ajusté par apprentissage supervisé, l'équipe a appliqué l'optimisation relative de politique de groupe (GRPO) avec une récompense basée sur deux modèles d'estimation de la qualité sans référence, contrôlés par identification de la langue.

arxiv arXiv cs.CL · il y a 4 j · 10 vues

Macaron-V1 présente une famille de modèles-agents ouverte avec Mixture-of-LoRA pour l'apprentissage continu

Macaron-V1 est une famille de modèles-agents ouverte conçue pour l'intelligence expérientielle, permettant aux systèmes d'apprendre à partir d'expériences du monde réel et de continuer à s'améliorer après le déploiement. L'architecture repose sur deux objectifs : l'adaptation par l'amélioration récursive des paires modèle-harnais, et la collaboration via un système Mixture-of-LoRA (MoL) qui sélectionne des adaptateurs spécialisés pour chaque tour utilisateur.

arxiv arXiv cs.CL · il y a 5 j · 8 vues

GPT-5 et GPT-5 Nano égalent les experts dans l'extraction de preuves sur l'oncogenèse microbienne

Une étude évaluant les grands modèles de langage (LLM) pour la synthèse systématique de preuves sur l'oncogenèse microbienne a révélé que GPT-5 et GPT-5 Nano performent de manière indistinguable des experts du domaine. Les chercheurs ont évalué Gemini 2.5 Pro, Gemini 2.5 Flash, GPT-5 et GPT-5 Nano sur 24 articles de recherche en utilisant un modèle structuré de 77 éléments couvrant plusieurs types de questions.

arxiv arXiv cs.CL · il y a 8 j · 4 vues

M$^3$R-Bench introduit un benchmark ancré dans les preuves pour la compréhension des métaphores multimodales

Les chercheurs présentent M$^3$R-Bench, un benchmark unifié contenant 1 000 instances image-texte avec des annotations vérifiées par des humains, conçu pour évaluer la compréhension des métaphores multimodales ancrées dans les preuves. Le benchmark fournit des annotations conjointes pour l'occurrence de la métaphore, le mappage Cible-Source, le sentiment et des explications étape par étape basées sur la Théorie de la Métaphore Conceptuelle.

arxiv arXiv cs.CL · il y a 11 j OSWorld 2.0 · 21.2% · 18 vues

Qwen publie Qwen-CUA, un agent d'utilisation native du ordinateur de 397B-A17B

Les chercheurs ont présenté Qwen-CUA, un agent d'utilisation native du ordinateur construit sur une colonne vertébrale à experts mélangés Qwen de 397B-A17B. Le système fonctionne en observant des captures d'écran et en agissant par le biais d'événements clavier et souris, sans s'appuyer sur les arbres DOM ou les métadonnées d'accessibilité.

arxiv arXiv cs.CL · il y a 11 j

Les moniteurs de chaîne de pensée s'effondrent lorsque les adversaires réécrivent le raisonnement

La recherche démontre que la surveillance de la chaîne de pensée (CoT) échoue face aux adversaires qui contrôlent le processus de raisonnement. En réécrivant le raisonnement d'un agent pour qu'il semble être un ingénierie de bonne foi tout en conservant les commandes et les sorties mot pour mot, les attaquants peuvent contourner les mécanismes de détection.

arxiv arXiv cs.CL · il y a 15 j · 4 vues

Mémoire à l'échelle : Passage à l'échelle des modèles de mémoire à long terme paramétrique jusqu'à 6,9 milliards de paramètres

Les chercheurs présentent Memory Decoder at Scale, un système qui met à l'échelle les modèles de mémoire à long terme paramétrique jusqu'à 6,9 milliards de paramètres et les pré-entraîne sur 300 milliards de tokens. Pour pallier l'irréalisme des pipelines Faiss standards à cette échelle de données, les auteurs implémentent un pipeline d'indexation distribué avec un chargement par lots et dispersé des distributions kNN.

arxiv arXiv cs.CL · il y a 15 j MLE-bench · 71.21% · 3 vues

Frontis-MA1 atteint l'état de l'art en MLE grâce à l'amélioration récursive par soi-même via OpenMLE

Frontis publie Frontis-MA1, un modèle AI4AI de 35 milliards de paramètres conçu pour l'amélioration récursive par soi-même en ingénierie du machine learning, accompagné de la pile open-source OpenMLE. Le système intègre des environnements de tâches vérifiables, l'apprentissage par opérateurs et une recherche à long horizon pour permettre à un agent d'améliorer son propre code grâce à un entraînement ancré dans l'exécution.

arxiv arXiv cs.CL · il y a 15 j · 4 vues

OSReward introduit une évaluation standardisée pour les modèles de récompense d'utilisation d'ordinateur multiplateformes

Les chercheurs présentent OSReward, un benchmark réaliste conçu pour évaluer la fiabilité des modèles vision-langage (VLM) agissant comme juges pour les trajectoires d'agents utilisant un ordinateur. L'étude révèle que même les VLM les plus avancés souffrent d'un biais de clémence systématique et sont souvent trop coûteux à l'échelle, tandis que les modèles ouverts abordables performe mal.

arxiv arXiv cs.CL · il y a 16 j · 5 vues

Living-Harness auto-évolue les agents de harnachement pour améliorer Pass@1 d'environ 10 points

Les chercheurs proposent Living-Harness, un agent de harnachement auto-évolutif qui convertit les trajectoires terminées et les signaux d'évaluateur en preuves a posteriori pour des mises à jour bornées du harnachement. Guidé par une Evolution-SOP, le système extrait des abstractions d'épisodes et des preuves de mise à jour structurées pour écrire la mémoire épisodique et les graphes d'état.

arxiv arXiv cs.CL · il y a 16 j · 3 vues

L'entraînement constitutionnel intermédiaire procure des gains d'alignement durables sans perte de capacités

Les chercheurs ont testé l'entraînement constitutionnel intermédiaire en insérant du contenu basé sur des valeurs dans le processus d'entraînement de modèles à 120 milliards de paramètres afin de déterminer s'il produit un alignement plus durable que les méthodes standard post-entraînement. L'étude a révélé que cette approche améliore significativement la généralisation et la durabilité de l'alignement, en particulier dans l'atténuation de la propension au chantage après un ajustement fin supervisé.

arxiv arXiv cs.CL · il y a 17 j · 1 vue

Relay-OPD réduit la longueur de la trajectoire d'entraînement de plus de 50 % lors de la distillation on-policy

Les chercheurs introduisent la Distillation On-Policy par Relais (Relay-OPD) pour pallier l'échec du préfixe dans la distillation on-policy standard, où les erreurs de l'élève entraînent une supervision peu fiable. La méthode utilise une asymétrie de continuation professeur-élève comme déclencheur permettant au professeur d'intervenir brièvement pour rediriger la trajectoire avant que l'élève ne reprenne.

arxiv arXiv cs.CL · il y a 18 j · 3 vues

PIVOT partage les scans de préfixe entre groupes de requêtes pour accélérer l'attention sparse au niveau des tokens

PIVOT (Proxy Indexing Via One full-prefix Traversal) est un remplacement plug-in sans entraînement pour l'indexeur DeepSeek Sparse Attention (DSA) qui réduit la redondance computationnelle en partageant un seul scan de préfixe entre un groupe de requêtes proches. Au lieu de scorer chaque token précédent pour chaque requête individuellement, PIVOT agrège le groupe en une seule requête proxy pour obtenir un ensemble de candidats, à partir duquel les top-k tokens sont sélectionnés pour chaque requête.