Бенчмарк · agentic

τ²-bench

19 результатов 15 моделей

τ²-bench — обновлённая версия τ-bench, которая проверяет разговорных ИИ-агентов, использующих инструменты, на задачах с «двойным управлением» (dual-control), где действия для выполнения задачи могут совершать и агент, и симулированный пользователь. Главная метрика — процент успешно решённых задач (средняя награда по задачам).

Подробнее
Пример
Сценарий техподдержки: агент находит учётную запись клиента и следует политике домена, одновременно направляя симулированного пользователя выполнить шаги на его собственном устройстве (например, изменить настройку), и обе стороны должны скоординироваться, чтобы решить проблему.
Метрика
Каждая задача завершается автоматической проверкой того, совпадает ли итоговое состояние системы/базы данных с требуемым результатом, что даёт награду за задачу; итоговый показатель — процент решённых задач (или средняя награда).
Приёмка
Приёмка полностью программная — окружение сравнивает конечное состояние (и обязательные действия) с ожидаемым результатом без участия человека, поэтому задача засчитывается только при совпадении результата.
Почему важно
Это важно, потому что реальные ассистенты часто не могут действовать в одиночку — им нужно инструктировать пользователя и координироваться с ним, — а режим двойного управления выявляет сбои в коммуникации и координации, которые пропускают бенчмарки с одним действующим лицом.
Разбор примера
Задача
τ²-bench, телеком-домен (dual-control): симулированный пользователь пишет: «С утра не работает мобильный интернет, но звонки и SMS проходят». Имея документ с политикой оператора и инструменты — плюс действия на устройстве, которые пользователь может выполнить на своём телефоне, — аутентифицируйте клиента, диагностируйте неисправность и восстановите мобильный интернет.
Решение
Correct agent trajectory (telecom tools + user-side device actions): 1. get_customer_by_phone(number); confirm identity via name + DOB. 2. get_line_status(line_id) → "active"; get_network_status(region) → "operational" (rules out account suspension and network outage). 3. Follow the "data down / voice up" branch: user confirms Airplane Mode is OFF, then agent instructs the user to switch "Mobile Data" ON. 4. Verify data is restored; apply NO billing credit (policy forbids a fee/credit for a self-service fix). Resolution → user enables Mobile Data; connectivity restored, account state unchanged.
Разбор
Раз голос и SMS работают, а данные не идут при активной линии и без сбоя сети, неисправность на стороне устройства, поэтому дерево диагностики из политики решает её, направляя пользователя снова включить Mobile Data (и запрещает начислять компенсацию за самостоятельное исправление). τ²-bench выставляет за задачу вознаграждение (0/1), проверяя, что окружение/база данных приходит в ожидаемое конечное состояние и что все требуемые действия и переданная информация присутствуют, а затем сообщает надёжность по серии повторов через метрику pass^k.
0 25 50 75 100 2024-10-22 2025-09-14 2026-08-08 Claude 3.5 Sonnet · 69.2 · 2024-10-22 Claude 3.7 Sonnet · 81.2 · 2025-02-24 Kimi K2 · 66.1 · 2025-07-28 Kimi K2 · 66.1 · 2025-07-28 GLM-4.5 · 90.6 · 2025-08-06 GPT‑5 · 96.7 · 2025-08-07 GPT-5 · 63.5 · 2025-08-07 Kimi K2 Thinking · 93 · 2025-11-07 Kimi K2 Thinking · 93 · 2025-11-19 GPT-5.2 Thinking · 98.7 · 2025-12-11 GPT-5.2 Thinking · 98.7 · 2025-12-11 GPT-5.2 Thinking · 98.7 · 2025-12-11 Claude Opus 4.6 · 91.9 · 2026-02-05 Step 3.5 Flash · 88.2 · 2026-02-10 GPT-5.5 · 98 · 2026-04-25 ToolGraph+DPO · 35.5 · 2026-06-23 ToolGraph · 33.8 · 2026-06-23 AgentOmnia (starting from Qwen3-30B-A3B-Thinking-2507) · 41.7 · 2026-07-28 Pokee-Isaac 28B · 66.2 · 2026-08-08
Claude 3.5 Sonnet Claude 3.7 Sonnet Kimi K2 GLM-4.5 GPT‑5 GPT-5 Kimi K2 Thinking GPT-5.2 Thinking Claude Opus 4.6 Step 3.5 Flash GPT-5.5 ToolGraph+DPO ToolGraph AgentOmnia (starting from Qwen3-30B-A3B-Thinking-2507) Pokee-Isaac 28B
Хронология
Дата Модель Результат Источник
2026-08-08 Pokee-Isaac 28B 66.2% Pokee AI выпустила Pokee-Isaac 28B — модель с контекстом на 10M токенов для развёртывания в контролируемой среде
2026-07-28 AgentOmnia (starting from Qwen3-30B-A3B-Thinking-2507) 41.69% AgentOmnia масштабирует агентные модели для приложений полного цикла
2026-06-23 ToolGraph+DPO 35.5% Саморазвитие агентов, использующих инструменты, через обучение предпочтений в точках разрыва
2026-06-23 ToolGraph 33.8% Саморазвитие агентов, использующих инструменты, через обучение предпочтений в точках разрыва
2026-04-25 GPT-5.5 98.0% OpenAI выпустила GPT-5.5: модель с нуля переобученная для нативной омнимодальной обработки
2026-02-10 Step 3.5 Flash 88.2% Шаг 3.5 Flash: открытая MoE-модель с 11B активных параметров достигает уровня передовых агентов
2026-02-05 Claude Opus 4.6 91.9% Anthropic выпустила Claude Opus 4.6 с контекстным окном на 1M токенов и улучшениями для агентов
2025-12-11 GPT-5.2 Thinking 98.7% OpenAI выпустила GPT-5.2, превосходящую Gemini 3 в тестах по программированию и рассуждению
2025-12-11 GPT-5.2 Thinking 98.7% OpenAI представляет GPT-5.2 с улучшенными возможностями программирования, работы с длинным контекстом и рассуждений
2025-12-11 GPT-5.2 Thinking 98.7% OpenAI представляет GPT-5.2 с передовыми возможностями для профессиональной интеллектуальной работы
2025-11-19 Kimi K2 Thinking 93.0% Moonshot AI выпустила Kimi K2 Thinking с агентным использованием инструментов
2025-11-07 Kimi K2 Thinking 93.0% Moonshot AI выпустила Kimi K2 Thinking, открытую модель рассуждений на 1 трлн параметров
2025-08-07 GPT‑5 96.7% OpenAI выпустила API GPT-5 с улучшениями для кодинга и агентов
2025-08-07 GPT-5 63.5% OpenAI запускает унифицированную GPT-5 с маршрутизацией в реальном времени и бесплатным доступом
2025-08-06 GLM-4.5 90.6% Zhipu AI выпустила модели GLM-4.5, сопоставимые с Claude и DeepSeek
2025-07-28 Kimi K2 66.1% Kimi K2: открытая MoE-модель с 1T параметров и оптимизатором MuonClip
2025-07-28 Kimi K2 66.1% Moonshot выпустила Kimi K2, открытую агентную MoE-модель с 32B активных параметров
2025-02-24 Claude 3.7 Sonnet 81.2% Anthropic выпустила Claude 3.7 Sonnet с динамическим управлением рассуждением
2024-10-22 Claude 3.5 Sonnet 69.2% Anthropic обновляет Claude 3.5 Sonnet, выпускает Claude 3.5 Haiku и бета-версию функции «computer use»