Reasoning models
arxiv arXiv cs.CL · il y a 7 h · 11 vues

TelecomGPT-R1 : Post-apprentissage unifié pour le raisonnement sur des tâches télécom hétérogènes

Les chercheurs présentent TelecomGPT-R1, une famille de modèles de raisonnement télécom unifiés et open-source conçus pour automatiser les tâches d'ingénierie en raisonnant sur les normes, les configurations et les journaux. Le modèle comble les lacunes des LLM généralistes et spécialisés existants grâce à une approche structurée couvrant les axes du protocole, des connaissances, de la modélisation et des pannes.

media AI News (smol.ai) · il y a 10 j · 26 vues

OpenAI affirme un résultat de singularité de Navier-Stokes assisté par l'IA via une collaboration de 10 000 agents

Des comptes affiliés à OpenAI ont signalé qu'un effort assisté par l'IA a produit un résultat lié au problème de l'existence et de la régularité de Navier-Stokes, l'un des problèmes du prix du millénaire. L'affirmation porte sur un système collaboratif impliquant environ 10 000 agents entraînés pendant un an à l'aide de l'apprentissage par renforcement multi-agents.

lab NVIDIA Research · il y a 12 j · 12 vues

ReasAlign utilise le raisonnement pour défendre les agents LLM contre l'injection de prompts

Les chercheurs ont présenté ReasAlign, une solution au niveau du modèle conçue pour améliorer l'alignement de sécurité des grands modèles de langage (LLM) contre les attaques par injection indirecte de prompts. L'approche intègre des étapes de raisonnement structurées pour analyser les requêtes utilisateur et détecter les instructions conflictuelles, garantissant la continuité des tâches prévues par l'utilisateur.

lab OpenAI News · il y a 17 j · 34 vues

OpenAI met en garde contre les risques de l'IA à mesure que les modèles de raisonnement s'échellent

Dans un essai intitulé « An Alien Mind », OpenAI discute de l'avancement rapide des modèles de langage de raisonnement et du potentiel d'amélioration récursive. L'auteur exprime son inquiétude face au fait que l'intelligence machine dépasse les capacités humaines de manière transformative, principalement alimentée par la mise à l'échelle de la puissance de calcul plutôt que par des algorithmes conçus.

blog Simon Willison · il y a 21 j · 40 vues

Anthropic publie Claude Fable 5.1 avec des benchmarks de codage et de sciences améliorés

Anthropic a publié Claude Fable 5.1, une mise à jour du modèle qui établit un nouveau standard pour le codage, le travail cognitif et les tâches de résolution de problèmes à long terme. La publication met en évidence des gains de performances significatifs sur le nouveau benchmark Terminal-Bench-Science 0.1, où Fable 5.1 a obtenu un score de 52,6 %, comparé à 24,7 % pour Fable 5, 29,0 % pour Opus 5 et 22,4 % pour GPT-5.6 Sol.