В статье сообщается, что Kimi K3 (max) превосходит Sonnet 5 в бенчмарке Simple Bench.
- Kimi K3 (max) показывает более высокий результат, чем Sonnet 5, на этой конкретной оценке.
В статье сообщается, что Kimi K3 (max) превосходит Sonnet 5 в бенчмарке Simple Bench.
Исследование сравнило клиническую систему искусственного интеллекта Doctorina с участием восьми врачей и четырех автономных передовых языковых моделей в рамках 150 синтетических консультаций по первичной медико-санитарной помощи на польском языке.
Пользователь оценил Kimi K3 по сравнению с Claude Opus 4.8, запустив 34 промпта для генерации с одним примером и оценив полученные HTML-код, скриншоты и GIF с помощью Sonnet 4.6. Оценка показала, что Kimi K3 выдал лучшие результаты, чем Opus 4.8.
Kimi K3, модель с открытыми весами от Moonshot AI, демонстрирует производительность, сопоставимую с Claude Fable 5 от Anthropic на бенчмарке DeepSWE, при этом стоимость за задачу значительно ниже. В оценке от 16 июля 2026 года Kimi K3 достигла результата pass@1 на уровне 68,5% по сравнению с 69,9% у Fable 5, но превзошла её в сценариях с несколькими попытками и обеспечила превосходную эффективность затрат.
Согласно таблице лидеров Agent Arena, Kimi K3 демонстрирует уровень производительности, сопоставимый с Opus в задачах без анализа изображений. Хотя некоторые пользователи отмечают, что Opus может иметь преимущество в возможностях работы с изображениями, рейтинг указывает на равенство для других случаев использования.
Kimi K3 занял первое место в оценке SpreadsheetBench 2 от AfterQuery. Этот результат ставит его выше Claude Fable 5 в данном конкретном бенчмарке.
Мы используем cookie для аналитики и улучшения сайта. Вы можете принять или отклонить аналитические cookie. Политика конфиденциальности