DeepSeek выпустила обновлённую публичную бета-версию API для DeepSeek-V4-Flash одновременно с открытием доступа к весам модели, что ознаменовало значительный скачок производительности, достигнутый за счёт дообучения, а не изменений архитектуры. Модель сохраняет структуру из 284B общих и 13B активных параметров, но демонстрирует существенные улучшения в агентных возможностях и результатах на бенчмарках для программирования.

  • API DeepSeek-V4-Flash запущен с улучшенными агентными возможностями, превосходящими V4-Pro-Preview, поддерживает формат Responses API и адаптирован для Codex.
  • Результаты в Terminal-Bench выросли с 56.9 до 82.7 (+25.8 баллов), а Elo по GDPval-AA v2 увеличился с 1189 до 1559 без изменений размера модели или архитектуры.
  • Веса модели опубликованы под лицензией MIT, включают 256 маршрутизируемых экспертов с 6 активными на токен и модуль спекулятивного декодирования DSpark.
  • Выпуск усилил ценовую конкуренцию, разместив DeepSeek на парето-фронте между интеллектом и стоимостью по цене $0.14/$0.28 за 1M токенов со скидкой 98% при попадании в кэш.

Обновление демонстрирует, что оптимизации после дообучения могут значительно повысить полезность модели для сложных задач, сохраняя конкурентоспособные цены по сравнению с проприетарными аналогами.