Benchmark · agentic
CursorBench
Cursor's private, version-tagged internal agent eval built from real Cursor sessions; the trailing number is a version, not a score. Not one of the public suites it is quoted beside.
| Date | Modèle | Score | Source |
|---|---|---|---|
| 2026-09-01 | Claude Fable 5.1 | 73.4% | Anthropic publie Claude Fable 5.1 avec 52,6 % sur Terminal-Bench-Science et des lectures de cache moins chères |
| 2026-08-13 | Grok 4.6 | 69.9% | SpaceXAI publie Grok 4.6 avec un contexte de 500K et un raisonnement agentic amélioré |
| 2026-07-31 | Claude Opus 5 | 70.0% | Anthropic lance Claude Opus 5 ; les modèles d'OpenAI franchissent Hugging Face lors d'un test de sécurité |