Benchmark · agentic

τ²-bench

17 résultats 13 modèles

τ²-bench est une version mise à jour de τ-bench qui évalue les agents d'IA conversationnelle utilisant des outils sur des tâches à « contrôle double » (dual-control), où l'agent comme un utilisateur simulé peuvent effectuer des actions pour accomplir le travail. La métrique principale est le pourcentage de tâches résolues (la récompense moyenne sur les tâches).

En savoir plus
Exemple
Un scénario d'assistance technique : l'agent consulte le compte d'un client et suit la politique du domaine tout en guidant un utilisateur simulé pour qu'il effectue des étapes sur son propre appareil (par exemple modifier un réglage), et les deux doivent se coordonner pour résoudre le problème.
Notation
Chaque tâche se termine par une vérification automatique de la correspondance entre l'état final du système/de la base de données et le résultat attendu, ce qui donne une récompense par tâche ; le score rapporté est le pourcentage de tâches résolues (ou la récompense moyenne).
Vérification
L'acceptation est entièrement programmatique : l'environnement compare l'état final (et les actions requises) au résultat attendu, sans notation humaine, de sorte qu'une tâche ne compte que lorsque le résultat correspond.
Pourquoi c'est important
C'est important parce que les vrais assistants ne peuvent souvent pas agir seuls — ils doivent instruire un utilisateur et se coordonner avec lui — et ce dispositif à contrôle double révèle des défaillances de communication et de coordination que les benchmarks à acteur unique manquent.
Exemple résolu
Tâche
τ²-bench, domaine télécom (dual-control) : un utilisateur simulé écrit : « Depuis ce matin je n'ai plus de données mobiles, mais les appels et les SMS fonctionnent encore. » À partir du document de politique de l'opérateur et des outils — ainsi que des actions que l'utilisateur peut effectuer sur son propre téléphone —, authentifiez le client, diagnostiquez la panne et rétablissez les données mobiles.
Solution
Correct agent trajectory (telecom tools + user-side device actions): 1. get_customer_by_phone(number); confirm identity via name + DOB. 2. get_line_status(line_id) → "active"; get_network_status(region) → "operational" (rules out account suspension and network outage). 3. Follow the "data down / voice up" branch: user confirms Airplane Mode is OFF, then agent instructs the user to switch "Mobile Data" ON. 4. Verify data is restored; apply NO billing credit (policy forbids a fee/credit for a self-service fix). Resolution → user enables Mobile Data; connectivity restored, account state unchanged.
Explication
La voix et les SMS fonctionnant alors que les données sont coupées sur une ligne active et sans panne réseau, le défaut est côté appareil ; l'arbre de dépannage de la politique le résout donc en guidant l'utilisateur pour réactiver Mobile Data (et interdit tout geste commercial pour une réparation faite par l'utilisateur). τ²-bench attribue une récompense par tâche (0/1) en vérifiant que l'environnement/la base de données atteint l'état final attendu et que toutes les actions requises et les informations communiquées sont présentes, puis rapporte la fiabilité sur des essais répétés via la métrique pass^k.
0 25 50 75 100 2024-10-22 2025-09-14 2026-08-08 Claude 3.5 Sonnet · 69.2 · 2024-10-22 Claude 3.7 Sonnet · 81.2 · 2025-02-24 Kimi K2 · 66.1 · 2025-07-28 Kimi K2 · 66.1 · 2025-07-28 GLM-4.5 · 90.6 · 2025-08-06 GPT-5 · 63.5 · 2025-08-07 GPT‑5 · 96.7 · 2025-08-07 Kimi K2 Thinking · 93 · 2025-11-07 Kimi K2 Thinking · 93 · 2025-11-19 GPT-5.2 Thinking · 98.7 · 2025-12-11 GPT-5.2 Thinking · 98.7 · 2025-12-11 GPT-5.2 Thinking · 98.7 · 2025-12-11 Claude Opus 4.6 · 91.9 · 2026-02-05 Step 3.5 Flash · 88.2 · 2026-02-10 GPT-5.5 · 98 · 2026-04-25 AgentOmnia (starting from Qwen3-30B-A3B-Thinking-2507) · 41.7 · 2026-07-28 Pokee-Isaac 28B · 66.2 · 2026-08-08
Claude 3.5 Sonnet Claude 3.7 Sonnet Kimi K2 GLM-4.5 GPT-5 GPT‑5 Kimi K2 Thinking GPT-5.2 Thinking Claude Opus 4.6 Step 3.5 Flash GPT-5.5 AgentOmnia (starting from Qwen3-30B-A3B-Thinking-2507) Pokee-Isaac 28B
Chronologie
Date Modèle Score Source
2026-08-08 Pokee-Isaac 28B 66.2% Pokee AI publie Pokee-Isaac 28B, un modèle de contexte de 10M de tokens pour un déploiement en périmètre fermé
2026-07-28 AgentOmnia (starting from Qwen3-30B-A3B-Thinking-2507) 41.69% AgentOmnia étend les modèles agents à des applications de scénarios complets
2026-04-25 GPT-5.5 98.0% OpenAI lance GPT-5.5, un modèle entièrement réentraîné avec traitement omnimodal natif
2026-02-10 Step 3.5 Flash 88.2% Étape 3.5 Flash : un modèle MoE à 11B actifs atteint des performances agentic de pointe
2026-02-05 Claude Opus 4.6 91.9% Anthropic lance Claude Opus 4.6 avec une fenêtre de contexte de 1M et des améliorations agentic
2025-12-11 GPT-5.2 Thinking 98.7% OpenAI présente GPT-5.2 avec des capacités de codage, de contexte long et de raisonnement améliorées
2025-12-11 GPT-5.2 Thinking 98.7% OpenAI lance GPT-5.2, surpassant Gemini 3 dans les benchmarks de codage et de raisonnement
2025-12-11 GPT-5.2 Thinking 98.7% OpenAI présente GPT-5.2 avec des capacités de pointe pour le travail intellectuel professionnel
2025-11-19 Kimi K2 Thinking 93.0% Moonshot AI publie Kimi K2 Thinking avec utilisation d'outils agents
2025-11-07 Kimi K2 Thinking 93.0% Moonshot AI publie Kimi K2 Thinking, un modèle de raisonnement open-source de 1T paramètres
2025-08-07 GPT-5 63.5% OpenAI lance GPT-5 unifié avec routage en temps réel et accès gratuit
2025-08-07 GPT‑5 96.7% OpenAI lance l'API GPT-5 avec des améliorations pour le codage et les agents
2025-08-06 GLM-4.5 90.6% Zhipu AI publie les modèles GLM-4.5 rivalisant avec Claude et DeepSeek
2025-07-28 Kimi K2 66.1% Moonshot lance Kimi K2, un modèle MoE agénique ouvert avec 32 milliards de paramètres activés
2025-07-28 Kimi K2 66.1% Kimi K2 : modèle MoE ouvert avec 1T de paramètres et optimiseur MuonClip
2025-02-24 Claude 3.7 Sonnet 81.2% Anthropic publie Claude 3.7 Sonnet avec contrôle dynamique du raisonnement
2024-10-22 Claude 3.5 Sonnet 69.2% Anthropic met à jour Claude 3.5 Sonnet, lance Claude 3.5 Haiku et la version bêta de l'utilisation de l'ordinateur