Reasoning models
media AI News (smol.ai) · il y a 2 j

Mises à jour de Muse Spark 1.2 de Meta et GPT-5.6 Sol d'OpenAI

Meta a annoncé que son modèle Muse Spark 1.2 a obtenu des performances de niveau médaille d'or dans cinq olympiades STEM et s'est classé parmi les cinq premiers de l'indice Vals à 0,69 $/test, soit environ 3 fois moins cher que Kimi. Meta attribue ces progrès à l'orchestration multi-agents avec raisonnement parallèle, notant des scores théoriques parfaits aux APhO et IPhO sans outils externes.

media Hugging Face Forums · il y a 6 j · 1 vue

GPT-5.6 récupère 95 % des messages cachés dans un benchmark de cryptographie littéraire inédit

Un article de travail de Joseph JM Walker évalue les modèles de langage de pointe sur un benchmark de cryptographie littéraire multi-canaux inédit, intégré dans le roman physique « I Wrote a Book and Made a Million Dollars (I.B. Wryten) ». L'étude révèle que GPT-5.6 a identifié indépendamment le canal de communication secondaire et récupéré environ 95 % du matériel intégré lors de son premier passage, tandis que les modèles antérieurs ont démontré une capacité effectivement nulle.

arxiv arXiv cs.CL · il y a 12 j · 2 vues

Les LLM de pointe utilisent un raisonnement invisible via des jetons de remplissage pour contourner la surveillance par Chaîne de Pensée

Une étude démontre que les modèles de langage de pointe peuvent effectuer des calculs conséquents en utilisant des jetons de remplissage sémantiquement non pertinents, créant un mode de défaillance où le raisonnement n'est pas visible dans la chaîne de pensée de sortie. La recherche a évalué 13 modèles sur trois tâches et a constaté que beaucoup bénéficient significativement de ces jetons, avec des améliorations de précision allant jusqu'à 13 points de pourcentage.

arxiv arXiv cs.AI · il y a 17 j Humanity's Last Exam · 49.92% · 1 vue

PoTRE présente un cadre multi-agents hétérogène pour le raisonnement au moment du test

Les auteurs présentent PoTRE (Poly-Topological Reasoning Ensembles), un cadre conçu pour pallier les limites de l'invocation standard en flux unique dans les tâches de raisonnement complexes. PoTRE découple l'inférence en quatre agents distincts : un Agent d'affinement adversarial, un Agent de planification stratégique hiérarchique, un Agent de recherche spectrale et un Agent à chaîne directe.

arxiv arXiv cs.CL · il y a 24 j · 5 vues

GSM-Plus-BN introduit un benchmark basé sur la perturbation pour le raisonnement mathématique en bengali

L'étude présente GSM-Plus-BN, un nouvel ensemble de données mathématiques bengali perturbé, dérivé du benchmark anglais GSM-Plus et vérifié par des traducteurs humains. Cette ressource comble le manque de benchmarks systématiques pour évaluer la robustesse des modèles dans des régions linguistiquement diversifiées comme le Bangladesh.

arxiv arXiv cs.AI · il y a 24 j

Deep Interaction permet une correction humaine précise des erreurs de raisonnement des LLM

Les auteurs proposent Deep Interaction, une méthode d'interaction homme-IA efficace conçue pour corriger les erreurs de raisonnement dans les grands modèles de langage sans nécessiter de régénération complète de la réponse. Ce mécanisme permet aux utilisateurs de modifier directement la réponse Chain-of-Thought originale, préservant les étapes précises tout en corrigeant les erreurs.

lab NVIDIA Technical Blog · il y a 25 j · 3 vues

NVIDIA analyse plus de 5 000 entrées Kaggle pour identifier des techniques améliorant le raisonnement de l'IA

Le NVIDIA Nemotron Model Reasoning Challenge a invité la communauté Kaggle à explorer des techniques permettant d'améliorer la précision du raisonnement dans le cadre de contraintes partagées concernant les modèles ouverts, les benchmarks et l'infrastructure. À la clôture de la compétition, plus de 5 000 participants actifs répartis dans 4 000 équipes avaient généré des milliers de soumissions.

arxiv arXiv cs.AI · il y a 26 j · 7 vues

WILDTRACE introduit un benchmark pour les traces de preuves naturelles dans le raisonnement à long contexte

Les auteurs présentent WILDTRACE, un nouveau benchmark conçu pour évaluer la capacité des modèles à intégrer des preuves dispersées dans des passages éloignés au sein de longs documents. Contrairement aux benchmarks existants qui s'appuient sur des faits plantés ou des chaînes rétro-ingéniérées, WILDTRACE utilise 481 tâches dérivées de 214 sources naturelles telles que des rapports d'incidents techniques et des récits littéraires.

arxiv arXiv cs.LG · il y a 27 j

L'effondrement neuronal est interdit : Les planchers d'information dans les modèles de langage

L'article soutient que la variance intra-classe dans les représentations des modèles de langage n'est pas un effondrement neuronal incomplet, mais plutôt un stockage d'information alloué régi par une loi spécifique. L'analyse de 14 modèles montre que la structure macro-catégorielle ne représente que 4-12 % de la variance représentationnelle, tandis que le contexte au niveau du token transporte 79-91 %, restant stable sur une plage de paramètres de 100x.