Laboratoire · Zhipu AI
media MarkTechPost · il y a 14 h · 2 vues

Z.ai publie GLM-5.3 avec des capacités de codage et de cybersécurité améliorées grâce au post-apprentissage

Z.ai a publié GLM-5.3, une mise à jour de son modèle de 743 milliards de paramètres qui obtient des gains de performance par un post-apprentissage à grande échelle plutôt que par un réentraînement du modèle de base. La version est actuellement disponible via l'API Z.ai, le plan GLM Coding et ZCode, avec des poids publics prévus environ deux semaines après le lancement, suite aux évaluations de sécurité.

arxiv arXiv cs.LG · il y a 2 j HealthBench · 51.9% · 5 vues

Le système RAG clinique VITA égale ou surpasse les LLM de pointe sur HealthBench

Un système de génération augmentée par récupération (RAG) conçu spécifiquement, nommé VITA et destiné aux contextes à revenus faibles et moyens, a été évalué contre des modèles de langage larges à usage général sur le benchmark HealthBench. Sur 4 023 questions jugées par un juge GPT-4.1, VITA s'est classé premier avec 51,9 % des points possibles de la grille d'évaluation, surpassant GPT-5.4, o4-mini, Gemini 3.1 Pro et Claude Sonnet 4.6.

arxiv arXiv cs.LG · il y a 4 j · 2 vues

Macaron-V1 présente une famille de modèles d'agent ouverte avec Mixture-of-LoRA pour l'apprentissage continu

Macaron-V1 est une famille de modèles d'agent ouverte conçue pour l'intelligence expérientielle, permettant l'apprentissage à partir d'environnements réels et la poursuite de l'apprentissage après le déploiement. Le système se concentre sur deux objectifs : l'adaptation par l'amélioration récursive des paires modèle-harnais et la collaboration via une architecture Mixture-of-LoRA (MoL) qui sélectionne des adaptateurs LoRA spécialisés pour chaque tour utilisateur.

arxiv arXiv cs.CL · il y a 4 j · 10 vues

Macaron-V1 présente une famille de modèles-agents ouverte avec Mixture-of-LoRA pour l'apprentissage continu

Macaron-V1 est une famille de modèles-agents ouverte conçue pour l'intelligence expérientielle, permettant aux systèmes d'apprendre à partir d'expériences du monde réel et de continuer à s'améliorer après le déploiement. L'architecture repose sur deux objectifs : l'adaptation par l'amélioration récursive des paires modèle-harnais, et la collaboration via un système Mixture-of-LoRA (MoL) qui sélectionne des adaptateurs spécialisés pour chaque tour utilisateur.

arxiv arXiv cs.CL · il y a 15 j · 4 vues

OSReward introduit une évaluation standardisée pour les modèles de récompense d'utilisation d'ordinateur multiplateformes

Les chercheurs présentent OSReward, un benchmark réaliste conçu pour évaluer la fiabilité des modèles vision-langage (VLM) agissant comme juges pour les trajectoires d'agents utilisant un ordinateur. L'étude révèle que même les VLM les plus avancés souffrent d'un biais de clémence systématique et sont souvent trop coûteux à l'échelle, tandis que les modèles ouverts abordables performe mal.

media TLDR AI · il y a 16 j · 34 vues

xAI lance le mode Build ; les chercheurs appellent à un pacte de ralentissement de l'IA

xAI a lancé le « Mode Build » pour les abonnés SuperGrok Heavy, permettant aux utilisateurs de générer, modifier, prévisualiser et publier des sites web, des applications, des jeux et des tableaux de bord directement depuis le chat, sans configuration préalable. Parallèlement, plus d'un millier de collaborateurs d'entreprises d'IA de pointe ont signé une déclaration demandant au gouvernement américain de soutenir un effort international visant à développer des outils pour rythmer délibérément l'avancée du développement automatisé de l'IA.

arxiv arXiv cs.CL · il y a 18 j · 3 vues

PIVOT partage les scans de préfixe entre groupes de requêtes pour accélérer l'attention sparse au niveau des tokens

PIVOT (Proxy Indexing Via One full-prefix Traversal) est un remplacement plug-in sans entraînement pour l'indexeur DeepSeek Sparse Attention (DSA) qui réduit la redondance computationnelle en partageant un seul scan de préfixe entre un groupe de requêtes proches. Au lieu de scorer chaque token précédent pour chaque requête individuellement, PIVOT agrège le groupe en une seule requête proxy pour obtenir un ensemble de candidats, à partir duquel les top-k tokens sont sélectionnés pour chaque requête.

arxiv arXiv cs.CL · il y a 18 j · 2 vues

Le framework Zing améliore l'intelligence sociale des LLM via le benchmark SoMBench et l'ancrage Actio

Le rapport présente Zing, un framework intégré conçu pour améliorer l'intelligence sociale des grands modèles de langage en mesurant, intériorisant et ancrant les capacités sociales. Les auteurs présentent SoMBench, un benchmark fondé sur la psychologie couvrant 17 dimensions secondaires et 3 481 instances vérifiées par des experts, qui révèle que les LLM actuels ont une marge de progression significative, aucun modèle n'atteignant des performances proches du plafond.