Kimi K3 занял первое место в новом рейтинге FullStack на arena.ai.
Модель достигла первой позиции в этом недавно представленном бенчмарке.
Kimi K3 занял первое место в новом рейтинге FullStack на arena.ai.
Модель достигла первой позиции в этом недавно представленном бенчмарке.
Пользователь оценил Kimi K3 по сравнению с Claude Opus 4.8, запустив 34 промпта для генерации с одним примером и оценив полученные HTML-код, скриншоты и GIF с помощью Sonnet 4.6. Оценка показала, что Kimi K3 выдал лучшие результаты, чем Opus 4.8.
Сравнение Kimi K3 и GPT-5.6 Sol на бенчмарке DeepSWE показывает, что хотя GPT-5.6 Sol лидирует по качеству в режиме одного запроса (72,7% против 68,5%), Kimi K3 достигает более высоких показателей pass@k при k > 1 при значительно меньшей стоимости.
Kimi K3, модель с открытыми весами от Moonshot AI, демонстрирует производительность, сопоставимую с Claude Fable 5 от Anthropic на бенчмарке DeepSWE, при этом стоимость за задачу значительно ниже. В оценке от 16 июля 2026 года Kimi K3 достигла результата pass@1 на уровне 68,5% по сравнению с 69,9% у Fable 5, но превзошла её в сценариях с несколькими попытками и обеспечила превосходную эффективность затрат.
Выход Kimi-K3 сократил временной лаг между открытыми и закрытыми AI-фронтендами до всего 1,5 месяцев, согласно данным Artificial Analysis.
Согласно таблице лидеров Agent Arena, Kimi K3 демонстрирует уровень производительности, сопоставимый с Opus в задачах без анализа изображений. Хотя некоторые пользователи отмечают, что Opus может иметь преимущество в возможностях работы с изображениями, рейтинг указывает на равенство для других случаев использования.
Мы используем cookie для аналитики и улучшения сайта. Вы можете принять или отклонить аналитические cookie. Политика конфиденциальности