Тема · Benchmark results
media Together AI Blog · 2 д назад DeepSWE · 67.2% · 7 просмотров

DeepSeek-V4 Flash 0731 против GPT-5.6 Luna на DeepSWE: стоимость и программирование

Сравнение моделей DeepSeek-V4 Flash 0731 и GPT-5.6 Luna на бенчмарке DeepSWE показывает, что, хотя GPT-5.6 Luna является более сильным инженером, каскадная стратегия с использованием обеих моделей обеспечивает более высокую точность при меньшей стоимости.

media AI News (smol.ai) · 4 д назад Terminal-Bench 2 · 67.4% · 8 просмотров

Alibaba анонсировала Qwen3.8-Max с 2,4 трлн параметров и скорым открытием весов

Alibaba объявила о выпуске Qwen3.8-Max в качестве новой флагманской модели, описав её как разреженную архитектуру на 2,4 трлн параметров, ориентированную на долгосрочные агентные задачи, программирование и мультимодальное рассуждение. Компания подтвердила, что открытые веса для Qwen3.8-Max будут опубликованы на следующей неделе вместе с вариантом Qwen3.8-27B с открытыми весами.

media r/LocalLLaMA · 9 д назад · 13 просмотров

Обновление DeepSeek V4 Flash с улучшенными результатами в Terminal Bench и Toolathlon

DeepSeek обновил свою модель V4 Flash, выпустив новую версию 2026-07-31, которая демонстрирует значительный рост производительности по сравнению с предыдущей предварительной версией. Обновление включает результаты нескольких новых бенчмарков, а также улучшает показатели в существующих.

media Together AI Blog · 13 д назад DeepSWE · 72.7% · 1 просмотр

Kimi K3 превосходит GPT-5.6 Sol на DeepSWE pass@4 и обходится на 64% дешевле

Сравнение Kimi K3 и GPT-5.6 Sol на бенчмарке DeepSWE показывает, что хотя GPT-5.6 Sol лидирует по качеству в режиме одного запроса (72,7% против 68,5%), Kimi K3 достигает более высоких показателей pass@k при k > 1 при значительно меньшей стоимости.

media AI News (smol.ai) · 15 д назад · 4 просмотра

Anthropic запустила Claude Opus 5, вызвав споры о бенчмарках

Anthropic выпустила модель Claude Opus 5, что привело к пристальному вниманию к её производительности в задачах программирования и общих показателях, а также к возобновлению дискуссий об оценке моделей переднего края.

media Latent Space · 15 д назад · 1 просмотр

Anthropic выпустила Claude Opus 5 с ECI 159

Anthropic выпустила Claude Opus 5, новую модель переднего края, которая вызвала значительные дискуссии относительно результатов бенчмарков и практической производительности. Независимые оценки от Epoch AI сообщают о Индексе возможностей Epoch (ECI) 159 и SWE-ECI 161 для новой модели.

media Together AI Blog · 16 д назад · 5 просмотров

Kimi K3 соответствует Claude Fable 5 по качеству DeepSWE при стоимости в три раза ниже

Kimi K3, модель с открытыми весами от Moonshot AI, демонстрирует производительность, сопоставимую с Claude Fable 5 от Anthropic на бенчмарке DeepSWE, при этом стоимость за задачу значительно ниже. В оценке от 16 июля 2026 года Kimi K3 достигла результата pass@1 на уровне 68,5% по сравнению с 69,9% у Fable 5, но превзошла её в сценариях с несколькими попытками и обеспечила превосходную эффективность затрат.

arxiv τ²-bench (tau2-bench) · 17 д назад · 1 просмотр

τ-bench 1.0.1 исправляет оценку banking_knowledge, чтобы не наказывать осторожное поведение агента

Sierra Research выпустила τ-bench 1.0.1, которая корректирует схему оценки задачи `banking_knowledge`, прекращая наказание агентов за тщательные проверки и исправляя несколько несоответствий в данных. Обновление гарантирует, что пересчёт траекторий в лидерборде только увеличивает баллы, при этом ранее прошедшие симуляции не проваливаются.

media AI News (smol.ai) · 22 д назад · 4 просмотра

Moonshot выпустила Kimi K3: китайскую модель с открытыми весами, выделяющуюся сильными навыками программирования и эффективностью

Moonshot выпустила Kimi K3 — модель с открытыми весами, которая вызвала переоценку того, насколько близко китайские модели находятся к переднему краю. Выпуск характеризуется высокой производительностью в задачах программирования, агентных сценариях и работе с знаниями на длительном горизонте.

media Latent Space · 23 д назад · 1 просмотр

Moonshot AI выпускает Kimi K3 — открытую модель переднего края с 2,8 трлн параметров

Moonshot AI представила Kimi K3, новую модель класса переднего края с открытыми весами, включающую 2,8 триллиона общих параметров и нативные возможности мультимодального ввода. Официально позиционируемая как «Открытый интеллект переднего края», модель поддерживает контекстное окно на 1 миллион токенов и использует новые архитектурные компоненты, такие как Kimi Delta Attention (KDA) и Attention Residuals, для повышения эффективности.

media AI News (smol.ai) · 23 д назад · 2 просмотра

Moonshot выпустила Kimi K3 — открытую модель с 2,8 трлн параметров

Moonshot AI выпустила Kimi K3, передовую открытую модель с 2,8 триллионами параметров и нативной мультимодальной обработкой входных данных. Модель использует механизм Kimi Delta Attention (KDA) для ускорения декодирования в длинных контекстах и предназначена для долгосрочных агентных рабочих процессов в программировании.

blog Simon Willison · 23 д назад · 9 просмотров

Moonshot AI анонсировала Kimi K3 — модель с 2,8 трлн параметров по высокой цене

Китайская лаборатория искусственного интеллекта Moonshot AI представила Kimi K3, описывая её как свою самую мощную модель на сегодняшний день с 2,8 триллионами параметров. Модель в настоящее время доступна через веб-сайт и API, при этом выпуск с открытыми весами обещан к 27 июля 2026 года.

lab Hugging Face Blog · 24 д назад

DharmaOCR превосходит более новые модели на бразильском португальском благодаря специализации

DharmaOCR демонстрирует более высокое качество и стабильность извлечения данных, чем Mistral OCR4 и Unlimited-OCR, на бразильском португальском языке благодаря обучению в предметной области.

media The Batch · 2 д назад Code Arena (Elo) · 1577.0Elo · 1 просмотр

DeepSeek выпустила V4-Flash-0731, превосходящую V4-Pro при меньшей стоимости

DeepSeek выпустила DeepSeek-V4-Flash-0731, обновленную версию своей более легкой модели "Flash", которая превосходит более крупную DeepSeek-V4-Pro в независимых бенчмарках. Выпуск использует новый процесс тонкой настройки, сохраняя оригинальную архитектуру Mixture-of-Experts с 284 миллиардами общих параметров.

arxiv arXiv cs.AI · 3 д назад

SciCode-Verified исправляет дефекты бенчмарка, чтобы выявить истинную способность моделей к научному программированию

Авторы выявляют, что застой показателей на бенчмарке SciCode обусловлен существенными дефектами инструмента оценки, а не ограничениями возможностей моделей. Аудит 65 тестовых задач экспертами в предметной области выявил 263 дефекта, из которых 192 приводили к неверному отклонению правильных решений из-за таких проблем, как невозможность воспроизведения эталонных ответов и чрезмерно жесткие допуски.

media r/LocalLLaMA · 4 д назад · 2 просмотра

Qwen 3.8 Max набрал 1588 баллов в Debate Benchmark, по сравнению с 1462 у Qwen 3.7 Max

Qwen 3.8 Max достиг результата 1588 баллов на Debate Benchmark, улучшив показатель Qwen 3.7 Max, который составил 1462 балла. Этот бенчмарк оценивает, насколько хорошо большие языковые модели удерживают аргументацию в условиях состязательной многошаговой оппозииции по различным темам.