Une comparaison de DeepSeek V4 Pro 0813 et Claude Fable 5 sur le benchmark DeepSWE révèle qu'une stratégie de routage utilisant les deux modèles résout 82,7 % des tâches à 8,28 $ chacune, surpassant Fable seul (69,7 %) tout en étant nettement moins cher.
- Claude Fable 5 mène en précision à une seule tentative (69,7 % pass@1) et excelle dans Rust (85 %) et les travaux lourds de sérialisation, mais coûte 21,63 $ par rollout, environ 90 fois plus que DeepSeek V4 Pro 0813.
- DeepSeek V4 Pro 0813 est moins cher (0,24 $ par rollout) et atteint une précision plus élevée avec plusieurs tentatives (88,5 % pass@4 contre 84,1 % pour Fable), ce qui en fait le meilleur rapport qualité-prix pour les travaux à fort volume ou tolérants aux réessais.
- Les modèles montrent une corrélation par tâche faible (0,39), couvrant 107 des 113 tâches entre eux, ce qui justifie une approche en cascade : exécuter Pro en premier et escalader vers Fable uniquement lorsque cela est nécessaire.
L'analyse suggère que Fable 5 est mieux utilisé comme une escalation sélective pour des domaines spécifiques comme Rust plutôt que comme un modèle par défaut, tandis que DeepSeek V4 Pro 0813 offre une précision proche de celle de Fable à une fraction du coût.