Perbandingan antara DeepSeek V4 Pro 0813 dan Claude Fable 5 pada benchmark DeepSWE mengungkapkan bahwa strategi pengalihan yang menggunakan kedua model menyelesaikan 82,7% tugas dengan biaya masing-masing $8,28, mengungguli penggunaan Fable saja (69,7%) sambil menjadi jauh lebih murah.

  • Claude Fable 5 memimpin dalam akurasi upaya tunggal (pass@1 69,7%) dan unggul dalam Rust (85%) serta pekerjaan yang padat serialisasi, namun biayanya $21,63 per rollout, sekitar 90 kali lebih mahal daripada DeepSeek V4 Pro 0813.
  • DeepSeek V4 Pro 0813 lebih murah ($0,24 per rollout) dan mencapai akurasi lebih tinggi dengan beberapa upaya (pass@4 88,5% vs Fable 84,1%), menjadikannya nilai yang lebih baik untuk pekerjaan bervolume tinggi atau yang toleran terhadap pengulangan.
  • Model-model tersebut menunjukkan korelasi per-tugas yang rendah (0,39), mencakup 107 dari 113 tugas di antara mereka, yang membenarkan pendekatan berjenjang: menjalankan Pro terlebih dahulu dan meningkatkan ke Fable hanya ketika diperlukan.

Analisis ini menyarankan bahwa Fable 5 sebaiknya digunakan sebagai eskalasi selektif untuk domain tertentu seperti Rust daripada sebagai model default, sementara DeepSeek V4 Pro 0813 menawarkan akurasi mendekati Fable dengan biaya sepersekian dari harga aslinya.