Результаты DeepSeek V4 Flash 0731 на ARC-AGI
В статье представлены результаты бенчмарка ARC-AGI для модели DeepSeek V4 Flash 0731. Приведена ссылка на официальную страницу с результатами, размещенную организацией ARC Prize.
В статье представлены результаты бенчмарка ARC-AGI для модели DeepSeek V4 Flash 0731. Приведена ссылка на официальную страницу с результатами, размещенную организацией ARC Prize.
DeepSeek выпустила DeepSeek-V4-Flash-0731, обновленную версию своей более легкой модели "Flash", которая превосходит более крупную DeepSeek-V4-Pro в независимых бенчмарках. Выпуск использует новый процесс тонкой настройки, сохраняя оригинальную архитектуру Mixture-of-Experts с 284 миллиардами общих параметров.
Сравнение моделей DeepSeek-V4 Flash 0731 и GPT-5.6 Luna на бенчмарке DeepSWE показывает, что, хотя GPT-5.6 Luna является более сильным инженером, каскадная стратегия с использованием обеих моделей обеспечивает более высокую точность при меньшей стоимости.
Artificial Analysis обновила свой агентный индекс, присвоив Qwen 3.8 Max звание лучшей общей модели, поместив его выше Opus 5.
Авторы выявляют, что застой показателей на бенчмарке SciCode обусловлен существенными дефектами инструмента оценки, а не ограничениями возможностей моделей. Аудит 65 тестовых задач экспертами в предметной области выявил 263 дефекта, из которых 192 приводили к неверному отклонению правильных решений из-за таких проблем, как невозможность воспроизведения эталонных ответов и чрезмерно жесткие допуски.
Alibaba объявила о выпуске Qwen3.8-Max в качестве новой флагманской модели, описав её как разреженную архитектуру на 2,4 трлн параметров, ориентированную на долгосрочные агентные задачи, программирование и мультимодальное рассуждение. Компания подтвердила, что открытые веса для Qwen3.8-Max будут опубликованы на следующей неделе вместе с вариантом Qwen3.8-27B с открытыми весами.
Qwen 3.8 Max достиг результата 1588 баллов на Debate Benchmark, улучшив показатель Qwen 3.7 Max, который составил 1462 балла. Этот бенчмарк оценивает, насколько хорошо большие языковые модели удерживают аргументацию в условиях состязательной многошаговой оппозииции по различным темам.
Внутренняя оценка моделей с открытым весом на сложных агентных задачах показала, что DeepSeek v4 flash является самым быстрым и дешевым вариантом среди аналогов. Тестирование включало длительные рабочие процессы в нескольких приложениях, оцениваемые по детерминированным проверкам, требующим полного успеха.
Qwen3.8-Max (2.4T) — новая модель с открытыми весами, которая демонстрирует производительность, близкую к Kimi K3 и DeepSeek V4 Flash во всех категориях бенчмарков, а также превосходит их в задачах по программированию и разработке ПО.
Qwen 3.8-Max выпущен и в настоящее время занимает #2 позицию в таблице лидеров Vision Arena, уступая только Claude Fable 5 Max.
В статье сообщается, что модель DeepSeek-V4-Flash-0731 превзошла Fable-5, Sol и Kimi-K3 в шахматном бенчмарке.
Левент Булут опубликовал бенчмарк из трёх исследований, оценивающий надёжность машинно-сгенерированных аннотаций для турецкого нарративного корпуса, выявив значительные расхождения между автоматическими оценщиками и человеческим суждением. В исследовании проверялись шесть бинарных ремесленных признаков на 120 и 100 сценах с использованием детекторов на основе правил и моделей, включая Gemini 2.5 Flash, Grok, ChatGPT 5.5 и Claude Fable 5 High.
Модель DeepSeek-V4-Flash-0731 достигла показателя интеллектуального индекса 50, что соответствует производительности ведущих моделей от марта 2026 года, которые имели показатель 51.
Переведенный мем, циркулирующий на Reddit, указывает на то, что конкуренту пришлось снизить цены на 80% из-за конкурентного давления со стороны DeepSeek v4 flash. Эта модель с открытыми весами имеет 284 миллиарда общих параметров и 13 миллиардов активных параметров, обеспечивая превосходные показатели соотношения цены и производительности.
DeepSeek утверждает, что его новая общедоступная модель DeepSeek V4 Flash демонстрирует производительность на уровне Anthropic's Sonnet 5 и xAI's Grok 4.5 в бенчмарке DeepSWE.
Модель DeepSeek-V4-Flash-0731 теперь значительно превосходит DeepSeek-V4-Pro-Preview в различных тестовых бенчмарках.
Новая модель DeepSeek V4-Flash набрала 50 баллов в индексе ArtificialAnalysis. Этот результат ставит её всего на один балл ниже GLM-5.2 и GPT-5.6 Luna.
Модель DeepSeek-V4-Flash-0731 демонстрирует лучшие результаты по сравнению с GLM 5.2, сохраняя ту же цену, что и её предшественник.
DeepSeek обновил свою модель V4 Flash, выпустив новую версию 2026-07-31, которая демонстрирует значительный рост производительности по сравнению с предыдущей предварительной версией. Обновление включает результаты нескольких новых бенчмарков, а также улучшает показатели в существующих.
Пользователь оценил Kimi K3 по сравнению с Claude Opus 4.8, запустив 34 промпта для генерации с одним примером и оценив полученные HTML-код, скриншоты и GIF с помощью Sonnet 4.6. Оценка показала, что Kimi K3 выдал лучшие результаты, чем Opus 4.8.