Новая оценка агентных задач искусственного анализа, AA-Briefcase, показывает, что GLM-5.2 превосходит GPT-5.5 по производительности. Оценка оценивает выполнение реальных задач и способность к логическому мышлению в сценариях работы с знаниями.
GLM-5.2 превосходит GPT-5.5 в оценке AA-Briefcase
Доход Neocloud от SpaceX достигает $28 млрд в год на фоне обновлений OpenAI и Sakana
SpaceX заключила третью сделку по аренде GPU с Reflection AI, что выводит её годовую выручку примерно до $28 млрд при расчётной ставке более $10 в час за GPU Blackwell. Эта оценка примерно вдвое превышает оценку Coreweave, что подчеркивает быстрый рост и высокую ценовую власть на рынке ИИ-инфраструктуры.
OpenAI расширяет Daybreak, Sakana выпускает Fugu, GLM-5.2 набирает популярность
В новостях ИИ этой недели выделяются расширение программ кибербезопасности OpenAI, выпуск системой оркестрации Fugu от Sakana AI и растущее распространение модели с открытыми весами GLM-5.2.
Оценка агентных систем анализа для исследований с участием ИИ
Исследование оценивает четыре системы анализа ИИ на шести моделях языков, в результате чего OpenAIReview с GPT-5.5 достигает точности 83,0% при сопоставлении качества научных статей с внешними сигналами и обнаруживает 71,6% введённых ошибок. Реальные отзывы пользователей показывают положительную оценку, с соотношением голосов 1,44 к 1, однако ошибочные положительные результаты и незначительные замечания остаются частыми.
TutorMoments оценивает, знают ли ИИ-репетиторы, когда помогать, а когда воздерживаться
Исследователи представляют TutorMoments — фреймворк, предназначенный для измерения способности больших языковых моделей балансировать между педагогическим компромиссом предоставления поддержки и поощрения независимого мышления. Система, построенная на реальных стенограммах индивидуальных математических занятий с учениками, воспроизводит моменты принятия решений для оценки поведения модели по сравнению с аннотированными экспертами эталонными данными.
OpenAI выпустила GPT-5.6 с разделением моделей и агентным UX; Meta представила Muse Spark 1.1
OpenAI запустила GPT-5.6, представив новую модельную линейку Luna, Terra и Sol вместе с различными уровнями усилий для режимов Max и Ultra. Выпуск принес значительные изменения в интерфейсы ChatGPT Work и Codex, хотя изначально столкнулся с негативной реакцией пользователей из-за запутанной навигации и быстрого исчерпания квот.