Anthropic a publié Claude Fable 5.1, une mise à jour du modèle qui établit un nouveau standard pour le codage, le travail cognitif et les tâches de résolution de problèmes à long terme. La publication met en évidence des gains de performances significatifs sur le nouveau benchmark Terminal-Bench-Science 0.1, où Fable 5.1 a obtenu un score de 52,6 %, comparé à 24,7 % pour Fable 5, 29,0 % pour Opus 5 et 22,4 % pour GPT-5.6 Sol.
- Claude Fable 5.1 introduit cinq niveaux de raisonnement : low, medium, high, xhigh et max, sans option pour désactiver entièrement le raisonnement.
- Les tests sur une invite de génération SVG d'un pélican ont montré que les niveaux d'effort low et medium ont sauté les traces de raisonnement entièrement, tandis que les niveaux supérieurs ont produit des monologues internes détaillés.
- Le niveau de raisonnement 'max' a nécessité 65 927 tokens de sortie et coûté 3,30 $ pour la tâche, résultant en la sortie visuelle la plus détaillée parmi les modèles testés.
- L'animation du SVG généré en utilisant le niveau de réflexion 'high' a coûté 1,37 $ et a produit une vidéo avec des roues rotatives, bien que la direction soit incorrecte.
La mise à jour permet aux utilisateurs de comparer les performances du modèle à travers différents niveaux d'effort de raisonnement, révélant comment l'augmentation de l'investissement computationnel impacte la qualité et le détail de la sortie.