Два параметра API утроили баллы GPT-5.6 на ARC-AGI-3
Включение двух конкретных параметров API для GPT-5.6 привело к утроению его показателей производительности на бенчмарке ARC-AGI-3.
Включение двух конкретных параметров API для GPT-5.6 привело к утроению его показателей производительности на бенчмарке ARC-AGI-3.
Сравнение моделей DeepSeek-V4 Flash 0731 и GPT-5.6 Luna на бенчмарке DeepSWE показывает, что, хотя GPT-5.6 Luna является более сильным инженером, каскадная стратегия с использованием обеих моделей обеспечивает более высокую точность при меньшей стоимости.
Alibaba объявила о выпуске Qwen3.8-Max в качестве новой флагманской модели, описав её как разреженную архитектуру на 2,4 трлн параметров, ориентированную на долгосрочные агентные задачи, программирование и мультимодальное рассуждение. Компания подтвердила, что открытые веса для Qwen3.8-Max будут опубликованы на следующей неделе вместе с вариантом Qwen3.8-27B с открытыми весами.
DeepSeek обновил свою модель V4 Flash, выпустив новую версию 2026-07-31, которая демонстрирует значительный рост производительности по сравнению с предыдущей предварительной версией. Обновление включает результаты нескольких новых бенчмарков, а также улучшает показатели в существующих.
Сравнение Kimi K3 и GPT-5.6 Sol на бенчмарке DeepSWE показывает, что хотя GPT-5.6 Sol лидирует по качеству в режиме одного запроса (72,7% против 68,5%), Kimi K3 достигает более высоких показателей pass@k при k > 1 при значительно меньшей стоимости.
Anthropic выпустила модель Claude Opus 5, что привело к пристальному вниманию к её производительности в задачах программирования и общих показателях, а также к возобновлению дискуссий об оценке моделей переднего края.
Anthropic выпустила Claude Opus 5, новую модель переднего края, которая вызвала значительные дискуссии относительно результатов бенчмарков и практической производительности. Независимые оценки от Epoch AI сообщают о Индексе возможностей Epoch (ECI) 159 и SWE-ECI 161 для новой модели.
Kimi K3, модель с открытыми весами от Moonshot AI, демонстрирует производительность, сопоставимую с Claude Fable 5 от Anthropic на бенчмарке DeepSWE, при этом стоимость за задачу значительно ниже. В оценке от 16 июля 2026 года Kimi K3 достигла результата pass@1 на уровне 68,5% по сравнению с 69,9% у Fable 5, но превзошла её в сценариях с несколькими попытками и обеспечила превосходную эффективность затрат.
Sierra Research выпустила τ-bench 1.0.1, которая корректирует схему оценки задачи `banking_knowledge`, прекращая наказание агентов за тщательные проверки и исправляя несколько несоответствий в данных. Обновление гарантирует, что пересчёт траекторий в лидерборде только увеличивает баллы, при этом ранее прошедшие симуляции не проваливаются.
16 июля Moonshot AI выпустила свою новейшую флагманскую модель Kimi K3, архитектуру Mixture of Experts (MoE) с 2,8 триллиона параметров. Компания пообещала опубликовать веса модели 27 июля.
Moonshot выпустила Kimi K3 — модель с открытыми весами, которая вызвала переоценку того, насколько близко китайские модели находятся к переднему краю. Выпуск характеризуется высокой производительностью в задачах программирования, агентных сценариях и работе с знаниями на длительном горизонте.
Moonshot AI представила Kimi K3, новую модель класса переднего края с открытыми весами, включающую 2,8 триллиона общих параметров и нативные возможности мультимодального ввода. Официально позиционируемая как «Открытый интеллект переднего края», модель поддерживает контекстное окно на 1 миллион токенов и использует новые архитектурные компоненты, такие как Kimi Delta Attention (KDA) и Attention Residuals, для повышения эффективности.
Moonshot AI выпустила Kimi K3, передовую открытую модель с 2,8 триллионами параметров и нативной мультимодальной обработкой входных данных. Модель использует механизм Kimi Delta Attention (KDA) для ускорения декодирования в длинных контекстах и предназначена для долгосрочных агентных рабочих процессов в программировании.
Китайская лаборатория искусственного интеллекта Moonshot AI представила Kimi K3, описывая её как свою самую мощную модель на сегодняшний день с 2,8 триллионами параметров. Модель в настоящее время доступна через веб-сайт и API, при этом выпуск с открытыми весами обещан к 27 июля 2026 года.
DharmaOCR демонстрирует более высокое качество и стабильность извлечения данных, чем Mistral OCR4 и Unlimited-OCR, на бразильском португальском языке благодаря обучению в предметной области.
В статье представлены результаты бенчмарка ARC-AGI для модели DeepSeek V4 Flash 0731. Приведена ссылка на официальную страницу с результатами, размещенную организацией ARC Prize.
DeepSeek выпустила DeepSeek-V4-Flash-0731, обновленную версию своей более легкой модели "Flash", которая превосходит более крупную DeepSeek-V4-Pro в независимых бенчмарках. Выпуск использует новый процесс тонкой настройки, сохраняя оригинальную архитектуру Mixture-of-Experts с 284 миллиардами общих параметров.
Artificial Analysis обновила свой агентный индекс, присвоив Qwen 3.8 Max звание лучшей общей модели, поместив его выше Opus 5.
Авторы выявляют, что застой показателей на бенчмарке SciCode обусловлен существенными дефектами инструмента оценки, а не ограничениями возможностей моделей. Аудит 65 тестовых задач экспертами в предметной области выявил 263 дефекта, из которых 192 приводили к неверному отклонению правильных решений из-за таких проблем, как невозможность воспроизведения эталонных ответов и чрезмерно жесткие допуски.
Qwen 3.8 Max достиг результата 1588 баллов на Debate Benchmark, улучшив показатель Qwen 3.7 Max, который составил 1462 балла. Этот бенчмарк оценивает, насколько хорошо большие языковые модели удерживают аргументацию в условиях состязательной многошаговой оппозииции по различным темам.