Сравнение GLM-5.3 и Claude Fable 5 на бенчмарке DeepSWE показывает, что хотя обе модели демонстрируют практически идентичную точность первого ответа (69,0% против 69,7%), GLM-5.3 значительно более экономична и лучше справляется в сценариях с несколькими попытками.
- Стоимость GLM-5.3 составляет $3,99 за запуск по сравнению с $21,63 у Fable 5; разница в цене в 5,4 раза приводит к 17 решённым задачам на $100 против 3 у Fable.
- В метриках многократных попыток GLM-5.3 лидирует с показателем pass@2 в 81,1% (против 77,1%) и pass@4 в 87,6% (против 84,1%), демонстрируя более высокий потенциал.
- Модели являются близкими взаимозаменяемыми вариантами с корреляцией по задачам 0,65, что означает: запуск обеих добавляет мало разнообразия покрытия.
- GLM-5.3 выигрывает в пяти областях задач, включая параллелизм и долговечность, тогда как Fable 5 лидирует только в Rust (85% против 70%) и задачах с тяжёлой сериализацией.
Анализ приходит к выводу, что GLM-5.3 должна быть моделью по умолчанию для большинства задач программной инженерии благодаря более низкой стоимости и более широкому покрытию, а Fable 5 следует оставить как дорогой вариант эскалации специально для работы с Rust или критичной сериализацией.