Новый исследовательский документ от OpenAI демонстрирует, как агенты искусственного интеллекта фундаментально меняют характер труда. В исследовании подчеркивается способность этих агентов выполнять более длительные и сложные задачи по сравнению с тем, что было возможно ранее. Этот технологический прорыв способствует росту производительности в самых разных профессиональных ролях. Результаты указывают на существенный сдвиг в организации и выполнении работы благодаря автоматизации. Обрабатывая сложные рабочие процессы, ИИ-агенты позволяют пользователям достигать большей эффективности. Документ служит доказательством растущего влияния автономных систем на современную занятость.
Исследование OpenAI: ИИ-агенты трансформируют работу
Открытая оптимизация позволяет GPT-5.5 создавать собственный процесс улучшения
В статье представлена открытая оптимизация (OEO) — фреймворк, позволяющий оптимизатору передовой модели динамически формировать свой процесс улучшения в режиме онлайн, вместо того чтобы полагаться на предписанные конвейеры оптимизации. Авторы сравнивают OEO с двумя поэтапными подходами, SkillOpt и GEPA, в рамках 14 прямых сравнений для восьми конфигураций наборов данных, целевых моделей и моделей.
Модель Astra решает десять открытых задач в математике и теоретической информатике
Внутренняя модель Astra от OpenAI нашла решения десяти давних открытых задач в области математики и теоретической информатики, при этом аргументы были формализованы в Lean. Эти результаты охватывают многомерную геометрию, теорию кодирования, теорию групп и квантовую сложность, отвечая на вопросы, по которым не было прогресса как минимум десять лет.
OpenBioRQ: Бенчмарк для верности агентных исследований в биомедицине
OpenBioRQ вводит бенчмарк из 12 553 нерешённых вопросов в области биомедицинских исследований в 12 областях, разработанный для проверки верности и отказа агентных моделей. Он оценивает модели в условиях использования инструментов без ключей ответов, используя реальные доказательства последующих шагов, а не параметрические знания, и показывает значительное падение агентной способности на самые сложные вопросы, где инструменты больше не используются, несмотря на их критическую важность.
MacAgentBench запускает бенчмарк AI-агента для macOS
MacAgentBench представляет всесторонний бенчмарк, включающий 676 задач по 25 приложениям, 60% из которых включают взаимодействие как с графическим интерфейсом, так и с командной строкой. Используя детерминированные правилу-ориентированные оценки и оценку с использованием мелких контрольных точек, было установлено, что Claude Opus 4.6 на OpenClaw достигает 73,7% Pass@1, в основном благодаря своей библиотеке навыков, а не архитектуре платформы.
Охо-Сейт-Университет выпускает открытый Deep Research-агент QUEST-35B
Команда NLP Охо-Сейт-Университета выпустила QUEST-35B, открытый Deep Research-агент, обученный на примерно 32 картах H100 с использованием 8 000 синтетических образцов. Команда открыла доступ к рецепту обучения, коду, весам и наборам данных, при этом результаты тестирования показывают конкурентоспособную производительность по сравнению с ведущими закрытыми Deep Research-системами.