Kimi K3 занял первое место в оценке SpreadsheetBench 2 от AfterQuery. Этот результат ставит его выше Claude Fable 5 в данном конкретном бенчмарке.
Kimi K3 занял #1 место в SpreadsheetBench 2 от AfterQuery, обойдя Claude Fable 5
Doctorina превосходит врачей в диагностике первичной медико-санитарной помощи на синтетическом польском языке
Исследование сравнило клиническую систему искусственного интеллекта Doctorina с участием восьми врачей и четырех автономных передовых языковых моделей в рамках 150 синтетических консультаций по первичной медико-санитарной помощи на польском языке.
Kimi K3 превосходит Opus 4.8 в генерации HTML с одним примером
Пользователь оценил Kimi K3 по сравнению с Claude Opus 4.8, запустив 34 промпта для генерации с одним примером и оценив полученные HTML-код, скриншоты и GIF с помощью Sonnet 4.6. Оценка показала, что Kimi K3 выдал лучшие результаты, чем Opus 4.8.
Kimi K3 соответствует Claude Fable 5 по качеству DeepSWE при стоимости в три раза ниже
Kimi K3, модель с открытыми весами от Moonshot AI, демонстрирует производительность, сопоставимую с Claude Fable 5 от Anthropic на бенчмарке DeepSWE, при этом стоимость за задачу значительно ниже. В оценке от 16 июля 2026 года Kimi K3 достигла результата pass@1 на уровне 68,5% по сравнению с 69,9% у Fable 5, но превзошла её в сценариях с несколькими попытками и обеспечила превосходную эффективность затрат.
Kimi K3 занимает тот же уровень, что и Opus в мышлении на Agent Arena
Согласно таблице лидеров Agent Arena, Kimi K3 демонстрирует уровень производительности, сопоставимый с Opus в задачах без анализа изображений. Хотя некоторые пользователи отмечают, что Opus может иметь преимущество в возможностях работы с изображениями, рейтинг указывает на равенство для других случаев использования.
Kimi K3 (max) превосходит Sonnet 5 в Simple Bench
В статье сообщается, что Kimi K3 (max) превосходит Sonnet 5 в бенчмарке Simple Bench.