OpenAI представила GPT-6 Sol и Luna как более быстрые и доступные аналоги GPT-6 Astra, внедрив улучшения в области программирования, фактологической точности, использования компьютера и профессиональных задач в модели с низкой стоимостью.
- Anthropic выпустила Claude Opus 5.5, которая по большинству рабочих показателей соответствует Claude Fable 5.1, но обходится на 40% дешевле при запуске, чем Opus 5.
- SWE-Bench Pro V2 выходит с 642 задачами из 11 репозиториев, исправляя предыдущие ошибки в задачах и оптимизируя процессы оценки.
- Google представила RRSI — метод, который регулирует процесс, при котором ИИ-агенты рекурсивно улучшают себя, чтобы снизить переобучение на бенчмарках.
Эти обновления предоставляют пользователям более экономичные варианты моделей и строгие новые бенчмарки для оценки производительности ИИ.