Выпущен Terminal Bench 4.0, обновляющий бенчмарк для соответствия новым релизам моделей и борьбы с насыщением бенчмарков.
- Обновление включает данные производительности, показывающие, что GLM-5.3 находится на том же уровне, что и Fable 5, с учетом погрешности.
- В анонсе подчеркивается быстрая итерация TerminalBench для поддержания актуальности по сравнению с новыми моделями.
- Обсуждение в сообществе выделяет высокую вычислительную стоимость крупных бенчмарков, отмечая, что они требуют 5-10B токенов за один запуск.