Benchmark results
media The Batch · 2 д назад Code Arena (Elo) · 1577.0Elo · 1 просмотр

DeepSeek выпустила V4-Flash-0731, превосходящую V4-Pro при меньшей стоимости

DeepSeek выпустила DeepSeek-V4-Flash-0731, обновленную версию своей более легкой модели "Flash", которая превосходит более крупную DeepSeek-V4-Pro в независимых бенчмарках. Выпуск использует новый процесс тонкой настройки, сохраняя оригинальную архитектуру Mixture-of-Experts с 284 миллиардами общих параметров.

media Together AI Blog · 2 д назад DeepSWE · 67.2% · 7 просмотров

DeepSeek-V4 Flash 0731 против GPT-5.6 Luna на DeepSWE: стоимость и программирование

Сравнение моделей DeepSeek-V4 Flash 0731 и GPT-5.6 Luna на бенчмарке DeepSWE показывает, что, хотя GPT-5.6 Luna является более сильным инженером, каскадная стратегия с использованием обеих моделей обеспечивает более высокую точность при меньшей стоимости.

arxiv arXiv cs.AI · 3 д назад

SciCode-Verified исправляет дефекты бенчмарка, чтобы выявить истинную способность моделей к научному программированию

Авторы выявляют, что застой показателей на бенчмарке SciCode обусловлен существенными дефектами инструмента оценки, а не ограничениями возможностей моделей. Аудит 65 тестовых задач экспертами в предметной области выявил 263 дефекта, из которых 192 приводили к неверному отклонению правильных решений из-за таких проблем, как невозможность воспроизведения эталонных ответов и чрезмерно жесткие допуски.

media AI News (smol.ai) · 4 д назад Terminal-Bench 2 · 67.4% · 8 просмотров

Alibaba анонсировала Qwen3.8-Max с 2,4 трлн параметров и скорым открытием весов

Alibaba объявила о выпуске Qwen3.8-Max в качестве новой флагманской модели, описав её как разреженную архитектуру на 2,4 трлн параметров, ориентированную на долгосрочные агентные задачи, программирование и мультимодальное рассуждение. Компания подтвердила, что открытые веса для Qwen3.8-Max будут опубликованы на следующей неделе вместе с вариантом Qwen3.8-27B с открытыми весами.

media r/LocalLLaMA · 4 д назад · 2 просмотра

Qwen 3.8 Max набрал 1588 баллов в Debate Benchmark, по сравнению с 1462 у Qwen 3.7 Max

Qwen 3.8 Max достиг результата 1588 баллов на Debate Benchmark, улучшив показатель Qwen 3.7 Max, который составил 1462 балла. Этот бенчмарк оценивает, насколько хорошо большие языковые модели удерживают аргументацию в условиях состязательной многошаговой оппозииции по различным темам.

media r/LocalLLaMA · 5 д назад · 2 просмотра

DeepSeek v4 flash лидирует среди моделей с открытым весом по скорости и стоимости в агентных задачах

Внутренняя оценка моделей с открытым весом на сложных агентных задачах показала, что DeepSeek v4 flash является самым быстрым и дешевым вариантом среди аналогов. Тестирование включало длительные рабочие процессы в нескольких приложениях, оцениваемые по детерминированным проверкам, требующим полного успеха.

media r/LocalLLaMA · 6 д назад · 11 просмотров

Qwen3.8-Max показывает результаты на уровне Kimi K3 и DeepSeek V4 Flash в бенчмарках

Qwen3.8-Max (2.4T) — новая модель с открытыми весами, которая демонстрирует производительность, близкую к Kimi K3 и DeepSeek V4 Flash во всех категориях бенчмарков, а также превосходит их в задачах по программированию и разработке ПО.

media Hugging Face Forums · 7 д назад · 8 просмотров

Левент Булут оценивает надёжность аннотаций LLM при объективной проекции

Левент Булут опубликовал бенчмарк из трёх исследований, оценивающий надёжность машинно-сгенерированных аннотаций для турецкого нарративного корпуса, выявив значительные расхождения между автоматическими оценщиками и человеческим суждением. В исследовании проверялись шесть бинарных ремесленных признаков на 120 и 100 сценах с использованием детекторов на основе правил и моделей, включая Gemini 2.5 Flash, Grok, ChatGPT 5.5 и Claude Fable 5 High.

media r/LocalLLaMA · 9 д назад · 3 просмотра

Модель DeepSeek v4 flash с открытыми весами, 284B общих и 13B активных параметров, вынуждает снижать цены

Переведенный мем, циркулирующий на Reddit, указывает на то, что конкуренту пришлось снизить цены на 80% из-за конкурентного давления со стороны DeepSeek v4 flash. Эта модель с открытыми весами имеет 284 миллиарда общих параметров и 13 миллиардов активных параметров, обеспечивая превосходные показатели соотношения цены и производительности.

media r/LocalLLaMA · 9 д назад · 13 просмотров

Обновление DeepSeek V4 Flash с улучшенными результатами в Terminal Bench и Toolathlon

DeepSeek обновил свою модель V4 Flash, выпустив новую версию 2026-07-31, которая демонстрирует значительный рост производительности по сравнению с предыдущей предварительной версией. Обновление включает результаты нескольких новых бенчмарков, а также улучшает показатели в существующих.

media r/LocalLLaMA · 9 д назад

Kimi K3 превосходит Opus 4.8 в генерации HTML с одним примером

Пользователь оценил Kimi K3 по сравнению с Claude Opus 4.8, запустив 34 промпта для генерации с одним примером и оценив полученные HTML-код, скриншоты и GIF с помощью Sonnet 4.6. Оценка показала, что Kimi K3 выдал лучшие результаты, чем Opus 4.8.