Source · arXiv cs.LG
arxiv arXiv cs.LG · il y a 18 j · 3 vues

Moonshot AI publie Kimi K3, un modèle MoE de 2,8 T de paramètres avec un contexte de million de tokens

Moonshot AI a présenté Kimi K3, un modèle Mixture-of-Experts open-source comportant 2,8 billions de paramètres au total et 104 milliards de paramètres activés par token. Le modèle prend en charge des capacités visuelles natives et une fenêtre de contexte d'un million de tokens, exploitant l'attention Delta Kimi et Stable LatentMoE pour atteindre une efficacité de mise à l'échelle d'environ 2,5 fois supérieure à celle de son prédécesseur, Kimi K2.

arxiv arXiv cs.LG · il y a 19 h · 3 vues

Intern-S2-Preview : Modèle fondamental agentic scientifique

Les auteurs présentent Intern-S2-Preview, une série de modèles fondamentaux agentic scientifiques conçus pour soutenir la compréhension multimodale scientifique, le raisonnement, la génération et les tâches à long terme. Le pipeline d'entraînement commence par un pré-entraînement multimodal scientifique sur des documents scientifiques rendus, des données image-texte entrelacées et divers corpus scientifiques.

arxiv arXiv cs.LG · il y a 2 j HealthBench · 51.9% · 5 vues

Le système RAG clinique VITA égale ou surpasse les LLM de pointe sur HealthBench

Un système de génération augmentée par récupération (RAG) conçu spécifiquement, nommé VITA et destiné aux contextes à revenus faibles et moyens, a été évalué contre des modèles de langage larges à usage général sur le benchmark HealthBench. Sur 4 023 questions jugées par un juge GPT-4.1, VITA s'est classé premier avec 51,9 % des points possibles de la grille d'évaluation, surpassant GPT-5.4, o4-mini, Gemini 3.1 Pro et Claude Sonnet 4.6.

arxiv arXiv cs.LG · il y a 4 j · 2 vues

Macaron-V1 présente une famille de modèles d'agent ouverte avec Mixture-of-LoRA pour l'apprentissage continu

Macaron-V1 est une famille de modèles d'agent ouverte conçue pour l'intelligence expérientielle, permettant l'apprentissage à partir d'environnements réels et la poursuite de l'apprentissage après le déploiement. Le système se concentre sur deux objectifs : l'adaptation par l'amélioration récursive des paires modèle-harnais et la collaboration via une architecture Mixture-of-LoRA (MoL) qui sélectionne des adaptateurs LoRA spécialisés pour chaque tour utilisateur.

arxiv arXiv cs.LG · il y a 4 j · 11 vues

Des chercheurs exploitent la réutilisation du chiffrement inter-sessions pour voler les traces de raisonnement des API de LLM

Des chercheurs ont identifié une vulnérabilité dans la manière dont les principaux fournisseurs de grands modèles de langage gèrent les traces de raisonnement étape par étape, qui sont renvoyées sous forme de blocs chiffrés pour une utilisation côté client. Ils ont constaté que ces blocs chiffrés sont entièrement compatibles et interchangeables entre différentes sessions, utilisateurs et modèles au sein de l'écosystème d'un même fournisseur.

arxiv arXiv cs.LG · il y a 8 j

U-OPSD permet l'auto-distillation non supervisée sur politique pour les LLM

Les chercheurs proposent l'Auto-Distillation Non Supervisée sur Politique (U-OPSD), une méthode qui améliore les performances post-entraînement des grands modèles de langage en utilisant uniquement les générations du modèle lui-même, sans supervision externe. L'approche échantillonne plusieurs rollouts pour construire une pseudo-solution par vote majoritaire, puis distille la distribution d'un enseignant dans les préfixes de la complétion incorrecte la plus longue du modèle.

arxiv arXiv cs.LG · il y a 11 j OSWorld 2.0 · 21.2% · 20 vues

Qwen publie Qwen-CUA, un agent d'utilisation native du ordinateur de 397B-A17B

Qwen présente Qwen-CUA, un agent d'utilisation native du ordinateur construit sur une colonne vertébrale à experts mélangés de 397B-A17B qui opère via des captures d'écran et des événements d'entrée sans dépendre des arbres DOM ou des métadonnées d'accessibilité. Le système utilise un échafaudage pour maintenir jusqu'à 20 captures d'écran actives et a été entraîné en utilisant une flotte de déploiement cloud avec près de 100 000 vCPUs sur environ 40 000 tâches vérifiables.

arxiv arXiv cs.LG · il y a 24 j · 8 vues

SkewAdam utilise un état d'optimiseur en couches pour réduire la mémoire de formation MoE de 97 %

Les chercheurs présentent SkewAdam, un optimiseur conçu pour les modèles à mélange d'experts (MoE) qui alloue différents types d'état à des populations de paramètres distinctes afin de réduire drastiquement l'utilisation de la mémoire. En attribuant le momentum float32 et les moments seconds factorisés au noyau, les moments seconds factorisés aux experts, et les moments seconds exacts au routeur, SkewAdam réduit l'état de l'optimiseur de 50,6 Go à 1,29 Go pour un modèle de 6,78 milliards de paramètres.

arxiv arXiv cs.LG · il y a 29 j · 2 vues

RoboTTT étend les politiques robotiques à un contexte de 8 000 pas de temps

Les chercheurs présentent RoboTTT, une méthode d'entraînement qui étend le contexte visuo-moteur des modèles de base pour robots jusqu'à 8 000 pas de temps sans augmenter la latence d'inférence. La méthode intègre l'entraînement au moment du test (Test-Time Training) dans les politiques Vision-Language-Action en utilisant des poids rapides mis à jour par descente de gradient pendant l'entraînement et l'inférence.