L'équipe de Qwen a publié le modèle Qwen3.8 27B, qui surpasse Opus 5 Medium sur l'Index Agénique d'Artificial Analysis.
- Qwen3.8 27B obtient un score plus élevé que Opus 5 Medium sur le benchmark de l'Index Agénique d'Artificial Analysis.
L'équipe de Qwen a publié le modèle Qwen3.8 27B, qui surpasse Opus 5 Medium sur l'Index Agénique d'Artificial Analysis.
Claude Opus 5.5 est disponible, menant SimpleBench avec un score de 88,4 % et générant une attention significative de la communauté grâce à sa capacité à produire des vidéos explicatives de haute qualité.
Les chercheurs présentent SkillGym, un cadre qui transforme les compétences d'agents écrites par des humains en environnements d'entraînement exécutables et vérifiables pour des agents à grands modèles de langage. Le système utilise un pipeline compétence-tâche pour instancier des tâches concrètes et vérifier les résultats avec des contrôleurs basés sur du code.
Les développeurs de TrueForge, un harnais d'agents open-source modèle-neutre, l'ont comparé à Claude Managed Agents en utilisant le benchmark DevRev Enterprise-Bench. La comparaison a révélé que TrueForge peut égaler le taux de résolution des plateformes gérées tout en réduisant significativement la consommation de ressources.
Anthropic a publié Claude Fable 5.1 et Claude Mythos 5.1 en tant que ses nouveaux modèles phares pour le codage et le travail du savoir, se positionnant comme les modèles les plus avancés au monde pour des tâches autonomes et multi-étapes.
Ouroboros est un cadre pour agents auto-développants où les outils, les prompts et l'implémentation centrale s'améliorent via des commits révisés qui deviennent le runtime pour le travail ultérieur. Il opère par évolution libre récursive ou évolution du noyau pilotée par l'expérience, déclenchée par des bugs et des inefficacités trouvés lors de l'utilisation.
Nous utilisons des cookies pour mesurer l'audience et améliorer le site. Vous pouvez accepter ou refuser les cookies analytiques. Politique de confidentialité