Новая оценка агентных задач искусственного анализа, AA-Briefcase, показывает, что GLM-5.2 превосходит GPT-5.5 по производительности. Оценка оценивает выполнение реальных задач и способность к логическому мышлению в сценариях работы с знаниями.
GLM-5.2 превосходит GPT-5.5 в оценке AA-Briefcase
Доход Neocloud от SpaceX достигает $28 млрд в год на фоне обновлений OpenAI и Sakana
SpaceX заключила третью сделку по аренде GPU с Reflection AI, что выводит её годовую выручку примерно до $28 млрд при расчётной ставке более $10 в час за GPU Blackwell. Эта оценка примерно вдвое превышает оценку Coreweave, что подчеркивает быстрый рост и высокую ценовую власть на рынке ИИ-инфраструктуры.
OpenAI расширяет Daybreak, Sakana выпускает Fugu, GLM-5.2 набирает популярность
В новостях ИИ этой недели выделяются расширение программ кибербезопасности OpenAI, выпуск системой оркестрации Fugu от Sakana AI и растущее распространение модели с открытыми весами GLM-5.2.
Оценка агентных систем анализа для исследований с участием ИИ
Исследование оценивает четыре системы анализа ИИ на шести моделях языков, в результате чего OpenAIReview с GPT-5.5 достигает точности 83,0% при сопоставлении качества научных статей с внешними сигналами и обнаруживает 71,6% введённых ошибок. Реальные отзывы пользователей показывают положительную оценку, с соотношением голосов 1,44 к 1, однако ошибочные положительные результаты и незначительные замечания остаются частыми.
AISI публикует подтверждённые результаты оценки шести передовых моделей по пяти бенчмаркам
Британский Институт безопасности ИИ (AISI) опубликовал методы оценки и их результаты через платформу Evaluation Cards сервиса EvalEval, чтобы повысить воспроизводимость бенчмарков. В этот выпуск вошли подтверждённые результаты, контекст и информация о конфигурации для пяти конкретных бенчмарков: HealthBench, FrontierMath, Humanity's Last Exam, SWE-Bench Pro и Terminal-Bench 2.0.
Модели уровня Frontier оцениваются в игре log(N)-вопросов по Википедии
Исследование оценивает шесть языковых моделей уровня Frontier в задаче коммуникации двух агентов, где отвечающий на вопросы определяет цель из N абзацев Википедии, используя ровно log2(N) вопросов с ответами «да»/«нет». Эксперимент провёл 408 игр на наборах документов от 4 до 1024 абзацев, выявив значительные различия в производительности среди протестированных моделей.