Эмпирическое исследование 86 156 поправок на тестовые файлы из 33 596 запросов на внесение изменений, созданных агентами, показывает, что 80,2% поправок на тестовые файлы содержат слабые или отсутствующие явные сигналы оракла. Тестовые файлы с сильным ораклом значительно повышают вероятность слияния (OR = 1,28, p < 0,001) после корректировки на множество факторов, что указывает на то, что присутствие тестового файла в отдельности переоценивает степень верификации.
Сигналы Оракла в коде тестов, написанном агентами
ChronicleBio использует ИИ для лечения ПОТ; Mind Lab тестирует непрерывное обучение Macaron-V1
ChronicleBio, основанная бывшим руководителем OpenAI Фиджи Симо, использует ИИ и 153 терабайта данных крови для лечения синдрома постуральной ортостатической тахикардии (ПOTS). Тем временем модель Macaron-V1 от Mind Lab превосходит GLM-5.2 в бенчмарках за счёт динамического переключения между пятью экспертными модулями LoRA для непрерывного обучения.
Сделка AMD и Anthropic: AMD будет поставлять чипы MI450 и инвестирует $5 млрд
Компании AMD и Anthropic подписали крупное соглашение, касающееся десятков миллиардов долларов на серверы для ИИ, при этом Anthropic закупит до 2 гигаватт чипов AMD Instinct MI450 начиная с первой половины следующего года. Параллельно AMD инвестирует до $5 млрд в Anthropic по мере выполнения конкретных этапов развертывания, а обе компании совместно работают над определением подходящих центров обработки данных для оборудования.
Thinking Machines выпускает Inkling; Anthropic готовится к IPO; OpenAI обучает GPT-Red
Компания Thinking Machines выпустила модель Inkling с 975B параметров (mixture-of-experts), из которых 41B являются активными, и поддержкой мультимодального рассуждения. Одновременно Anthropic готовится к потенциальному IPO во второй половине этого года после раунда финансирования на $65 млрд при оценке компании в $965 млрд. OpenAI также обучила GPT-Red для итеративной генерации состязательных промптов, что сократило количество сбоев на бенчмарке инъекции промптов в шесть раз для GPT-5.6 Sol.
Claude Code получил встроенный браузер; Cursor разрабатывает универсального агента
Anthropic добавила встроенный браузер в Claude Code для десктопа, позволяя инструменту читать, переходить по ссылкам и взаимодействовать с веб-сайтами и документацией аналогично локальным dev-серверам. Тем временем сообщения указывают на то, что Cursor разрабатывает универсального ИИ-агента, предназначенного для обработки электронной почты, сообщений, электронных таблиц и инженерных задач.
GPT-5 превосходит людей в формировании состояний веры через планирование
Новое исследование оценивает способность больших языковых моделей формировать конкретные состояния веры у других агентов посредством действий, а не диалога; эта способность называется Непрерывное планирование ToM (NCP-ToM). Используя фреймворк NCP-ExploreToM, исследователи протестировали шесть передовых моделей и участников-людей на 600 задачах, где агентам нужно было перемещать объекты или направлять персонажей для достижения целей веры.