벤치마크 · agentic

Terminal-Bench 2

40 결과 31 모델

Harbor/Terminus-2 89-task terminal-agent suite; 2.0 and 2.1 are the same task set, so one series. File here only when the quote says 2.0 / 2.1 / v2 — not the original suite (terminal-bench), and not the harder 'Terminal-Bench Hard' subset (not in this catalog).

0 25 50 75 100 2025-11-19 2026-04-15 2026-09-10 GPT-5.1-Codex-Max · 58.1 · 2025-11-19 Step 3.5 Flash · 51 · 2026-02-10 MiniMax M2.7 · 57 · 2026-04-12 GPT-5.5 · 82.7 · 2026-04-23 GPT-5.5 · 82.7 · 2026-04-23 GPT-5.5 · 82.7 · 2026-04-25 Qwen3.6-27B · 59.3 · 2026-04-25 Qwen3.6-27B · 60.7 · 2026-08-10 GLM 5.2 FP8 with FP8 KV · 79.8 · 2026-07-05 LLM-as-a-Verifier · 86.5 · 2026-07-07 Grok 4.5 · 83.3 · 2026-07-08 hermes · 55 · 2026-07-08 Gemini 3.5 Flash-Lite · 54 · 2026-07-21 Gemini 3.5 Flash-Lite · 54 · 2026-07-21 Gemini 3.5 Flash-Lite · 54 · 2026-07-27 KAT-Coder-V2.5 · 60.7 · 2026-07-26 DeepSeek-V4-Flash · 82.7 · 2026-07-31 DeepSeek-V4-Flash · 79 · 2026-08-01 DeepSeek-V4-Flash-0731 · 82.7 · 2026-07-31 DeepSeek-V4-Flash-0731 · 82.7 · 2026-08-07 V4 Flash 0731 · 79 · 2026-08-01 Inkling-Small · 64.7 · 2026-08-03 Qwen3.8-Max · 86.6 · 2026-08-03 Qwen3.8-Max · 67.4 · 2026-08-05 Muse Spark 1.1 · 80 · 2026-08-05 Pokee-Isaac 28B · 65.1 · 2026-08-08 DeepSeek V4 Flash 0731 · 82.7 · 2026-08-09 Opus 5 · 86.7 · 2026-08-11 Grok 4.6 · 88.4 · 2026-08-13 Grok 4.6 · 88.4 · 2026-08-21 DeepSeek-V4-Pro · 87.9 · 2026-08-13 Ornith-1.5 · 86.1 · 2026-08-19 agents · 94 · 2026-08-20 DeepSeek-V4-Flash-Vision-Exp · 83.9 · 2026-08-21 Granite 4.2 30B · 29.2 · 2026-08-26 Granite 4.2 8B · 20.6 · 2026-08-26 Muse Spark 1.3 · 88.8 · 2026-09-04 K2-Horizon-MoVA-36B-A4B · 58.6 · 2026-09-07 K2-Horizon-375B-A23B · 66.9 · 2026-09-07 DeepSeek-V4.1-Flash · 90.6 · 2026-09-10
GPT-5.1-Codex-Max Step 3.5 Flash MiniMax M2.7 GPT-5.5 Qwen3.6-27B GLM 5.2 FP8 with FP8 KV LLM-as-a-Verifier Grok 4.5 hermes Gemini 3.5 Flash-Lite KAT-Coder-V2.5 DeepSeek-V4-Flash DeepSeek-V4-Flash-0731 V4 Flash 0731 Inkling-Small Qwen3.8-Max Muse Spark 1.1 Pokee-Isaac 28B DeepSeek V4 Flash 0731 Opus 5 Grok 4.6 DeepSeek-V4-Pro Ornith-1.5 agents DeepSeek-V4-Flash-Vision-Exp Granite 4.2 30B Granite 4.2 8B Muse Spark 1.3 K2-Horizon-MoVA-36B-A4B K2-Horizon-375B-A23B DeepSeek-V4.1-Flash
타임라인
날짜 모델 점수 출처
2026-09-10 DeepSeek-V4.1-Flash 90.6% DeepSeek, 네이티브 멀티모달 지원을 갖춘 V4.1-Flash 모델 출시
2026-09-07 K2-Horizon-MoVA-36B-A4B 58.6% IFM이 K2 Horizon 출시: 0.9B에서 375B까지 Apache 2.0 라이선스를 가진 여섯 개의 모델
2026-09-07 K2-Horizon-375B-A23B 66.9% IFM이 K2 Horizon 출시: 0.9B에서 375B까지 Apache 2.0 라이선스를 가진 여섯 개의 모델
2026-09-04 Muse Spark 1.3 88.8% Meta, 도구 호출 및 토큰을 줄인 Muse Spark 1.3 출시
2026-08-26 Granite 4.2 30B 29.24% IBM이 오픈 엔터프라이즈 모델을 위해 네이티브 추론과 에이전트 RL을 갖춘 Granite 4.2 출시
2026-08-26 Granite 4.2 8B 20.56% IBM이 오픈 엔터프라이즈 모델을 위해 네이티브 추론과 에이전트 RL을 갖춘 Granite 4.2 출시
2026-08-21 Grok 4.6 88.4% SpaceXAI가 에이전트 작업을 위한 Cursor 데이터를 활용한 Grok 4.6 출시
2026-08-21 DeepSeek-V4-Flash-Vision-Exp 83.9% DeepSeek, DeepSeek-V4-Flash-Vision-Exp 멀티모달 모델 출시
2026-08-20 agents 94.0% 메타, 네이티브 오디오를 지원하는 Muse Video 출시; 스트라이프가 OpenRouter 인수
2026-08-19 Ornith-1.5 86.1% Ornith-1.5가 자기 개선 훈련을 통해 9B, 35B-A3B, 397B 모델 출시
2026-08-13 DeepSeek-V4-Pro 87.9% DeepSeek-V4-Pro GA 릴리스로 에이전트 기능 강화 및 Responses API 지원 추가
2026-08-13 Grok 4.6 88.4% xAI, Grok 4.6 출시; 알리바바, Qwen3.8-MoE 오픈; DeepSeek V4 Pro GA
2026-08-11 Opus 5 86.74% 오로보로스 자기 개발 에이전트가 Opus 5로 새로운 벤치마크 기록 수립
2026-08-10 Qwen3.6-27B 60.7% Meta가 단일 소비자용 GPU에서 구동되는 30B 오픈 가중치 에이전트 모델인 Muse Glimmer를 출시
2026-08-09 DeepSeek V4 Flash 0731 82.7% DeepSeek V4 Flash 0731, 공개 하네스에서 Terminal-Bench 2.1 에 82.7% 달성
2026-08-08 Pokee-Isaac 28B 65.1% Pokee AI, 경계 내 배포용 10M 토큰 컨텍스트 모델 Pokee-Isaac 28B 출시
2026-08-07 DeepSeek-V4-Flash-0731 82.7% DeepSeek, V4-Flash-0731 출시, 더 낮은 비용으로 V4-Pro를 능가
2026-08-05 Muse Spark 1.1 80.0% Meta, Muse Spark 1.2 기반의 Muse Code 베타 터미널 에이전트 출시
2026-08-05 Qwen3.8-Max 67.4% 알리바바, 2.4T 파라미터를 갖춘 Qwen3.8-Max와 향후 오픈 가중치 발표
2026-08-03 Qwen3.8-Max 86.6% 알리바바, 2.4조 파라미터 MoE 모델인 Qwen3.8-Max 출시
2026-08-03 Inkling-Small 64.7% Thinking Machines Lab이 276B 오픈 가중치 멀티모달 MoE 모델인 Inkling-Small을 출시
2026-08-01 V4 Flash 0731 79.0% DeepSeek, 주요 사후 학습 향상과 오픈 가중치를 갖춘 V4-Flash 출시
2026-08-01 DeepSeek-V4-Flash 79.0% DeepSeek, 사후 학습 향상과 오픈 가중치를 갖춘 V4-Flash 출시
2026-07-31 DeepSeek-V4-Flash-0731 82.7% DeepSeek, 낮은 비용으로 주요 에이전트 성능 향상된 V4-Flash-0731 출시
2026-07-31 DeepSeek-V4-Flash 82.7% DeepSeek, 에이전트 기능 강화된 DeepSeek-V4-Flash 공개 베타 출시
2026-07-27 Gemini 3.5 Flash-Lite 54.0% 구글, Gemini 3.6 Flash, 3.5 Flash-Lite 및 3.5 Flash Cyber 출시
2026-07-26 KAT-Coder-V2.5 60.7% KwaiKAT가 100,000개 이상의 검증 가능한 환경에서 훈련된 에이전트 코딩 모델 KAT-Coder-V2.5를 출시
2026-07-21 Gemini 3.5 Flash-Lite 54.0% Google, 에이전트 워크로드를 위한 Gemini 3.6 Flash, 3.5 Flash-Lite, 3.5 Flash Cyber 출시
2026-07-21 Gemini 3.5 Flash-Lite 54.0% 구글, Gemini 3.6 Flash, 3.5 Flash-Lite 및 3.5 Flash Cyber 출시
2026-07-08 hermes 55.0% 사용자가 Mimo v2.5를 DeepSeek V4 Flash 및 Hermes와 벤치마킹
2026-07-08 Grok 4.5 83.3% xAI, 저비용 및 혼합 벤치마크 성능의 Grok 4.5 출시
2026-07-07 LLM-as-a-Verifier 86.5% LLM-as-a-Verifier이 연속 점수 매핑을 위한 범용 검증 프레임워크 도입
2026-07-05 GLM 5.2 FP8 with FP8 KV 79.8% GLM 5.2 FP8 및 FP8 KV로 Terminal-Bench 2.1에서 79.8% 달성
2026-04-25 Qwen3.6-27B 59.3% 알리바바, Qwen3.6-27B 출시, 더 큰 후속 모델보다 코딩 벤치마크에서 우위
2026-04-25 GPT-5.5 82.7% OpenAI, 네이티브 오미모달 처리를 갖춘 GPT-5.5 출시
2026-04-23 GPT-5.5 82.7% OpenAI, 에이전트 기능과 두 배의 API 가격으로 GPT-5.5 출시
2026-04-23 GPT-5.5 82.7% OpenAI, API를 통해 GPT-5.5 및 GPT-5.5 Pro 출시
2026-04-12 MiniMax M2.7 57.0% MiniMax가 자체 진화 MoE 모델 M2.7을 오픈소스로 공개, SWE-Pro에서 56.22% 점수 달성
2026-02-10 Step 3.5 Flash 51.0% 단계 3.5 Flash: 11B 활성 MoE 모델이 최전선 에이전트 성능 달성
2025-11-19 GPT-5.1-Codex-Max 58.1% OpenAI, Codex CLI의 기본 모델로 GPT-5.1-Codex-Max 채택