벤치마크 · agentic
Terminal-Bench 2
13 결과
10 모델
Harbor/Terminus-2 89-task terminal-agent suite; 2.0 and 2.1 are the same task set, so one series. File here only when the quote says 2.0 / 2.1 / v2 — not the original suite (terminal-bench), and not the harder 'Terminal-Bench Hard' subset (not in this catalog).
0
23
46
69
92
2025-11-19
2026-03-21
2026-07-21
GPT-5.1-Codex-Max · 58.1 · 2025-11-19
Step 3.5 Flash · 51 · 2026-02-10
MiniMax M2.7 · 57 · 2026-04-12
GPT-5.5 · 82.7 · 2026-04-23
GPT-5.5 · 82.7 · 2026-04-23
GPT-5.5 · 82.7 · 2026-04-25
Qwen3.6-27B · 59.3 · 2026-04-25
GLM 5.2 FP8 with FP8 KV · 79.8 · 2026-07-05
LLM-as-a-Verifier · 86.5 · 2026-07-07
Grok 4.5 · 83.3 · 2026-07-08
hermes · 55 · 2026-07-08
Gemini 3.5 Flash-Lite · 54 · 2026-07-21
Gemini 3.5 Flash-Lite · 54 · 2026-07-21
GPT-5.1-Codex-Max
Step 3.5 Flash
MiniMax M2.7
GPT-5.5
Qwen3.6-27B
GLM 5.2 FP8 with FP8 KV
LLM-as-a-Verifier
Grok 4.5
hermes
Gemini 3.5 Flash-Lite
타임라인
날짜▼
모델
점수
출처
2026-07-21
Gemini 3.5 Flash-Lite
54.0%
Google, 에이전트 워크로드를 위한 Gemini 3.6 Flash, 3.5 Flash-Lite, 3.5 Flash Cyber 출시
2026-07-21
Gemini 3.5 Flash-Lite
54.0%
구글, Gemini 3.6 Flash, 3.5 Flash-Lite 및 3.5 Flash Cyber 출시
2026-07-08
hermes
55.0%
사용자가 Mimo v2.5를 DeepSeek V4 Flash 및 Hermes와 벤치마킹
2026-07-08
Grok 4.5
83.3%
xAI, 저비용 및 혼합 벤치마크 성능의 Grok 4.5 출시
2026-07-07
LLM-as-a-Verifier
86.5%
LLM-as-a-Verifier이 연속 점수 매핑을 위한 범용 검증 프레임워크 도입
2026-07-05
GLM 5.2 FP8 with FP8 KV
79.8%
GLM 5.2 FP8 및 FP8 KV로 Terminal-Bench 2.1에서 79.8% 달성
2026-04-25
Qwen3.6-27B
59.3%
알리바바, Qwen3.6-27B 출시, 더 큰 후속 모델보다 코딩 벤치마크에서 우위
2026-04-25
GPT-5.5
82.7%
OpenAI, 네이티브 오미모달 처리를 갖춘 GPT-5.5 출시
2026-04-23
GPT-5.5
82.7%
OpenAI, API를 통해 GPT-5.5 및 GPT-5.5 Pro 출시
2026-04-23
GPT-5.5
82.7%
OpenAI, 에이전트 기능과 두 배의 API 가격으로 GPT-5.5 출시
2026-04-12
MiniMax M2.7
57.0%
MiniMax가 자체 진화 MoE 모델 M2.7을 오픈소스로 공개, SWE-Pro에서 56.22% 점수 달성
2026-02-10
Step 3.5 Flash
51.0%
단계 3.5 Flash: 11B 활성 MoE 모델이 최전선 에이전트 성능 달성
2025-11-19
GPT-5.1-Codex-Max
58.1%
OpenAI, Codex CLI의 기본 모델로 GPT-5.1-Codex-Max 채택