ベンチマーク · agentic

Terminal-Bench

27 結果 17 モデル

Terminal-Bench は、AI エージェントがターミナルで実際のコマンドライン作業(ソフトウェアのインストール、デバッグ、システム操作など)をどれだけうまくこなせるかを測ります。スコアはエージェントが正常に完了したタスクの割合(%)です。

詳しく見る
典型的なタスクでは、壊れた環境や空の環境が与えられ、それを動作する状態にするよう求められます。たとえば、正しい依存関係をインストールし、設定を修正してプログラムが動くようにする作業を、すべてターミナルのコマンドで行います。
採点方法
各タスクはエージェントが必要な最終状態に到達したかどうかで合否が判定され、ベンチマークのスコアは全タスクのうち解けたタスクの割合(%)です。
検証方法
結果は、隔離されたサンドボックス(sandbox)環境内の自動チェックがタスクの意図した成果の達成を確認した場合にのみ受理されます(人間の投票や厳密なテキスト一致ではありません)。
重要な理由
コマンドラインからのインストール・デバッグ・システム運用といったターミナルのスキルは実際のエンジニアリング作業の中核であり、このベンチマークはエージェントが本物のコマンドラインで自律的かつ確実に動けるかを示します。より難しい 2.x 版があり、エージェントの進歩に合わせて基準を高く保ちます。
解説付きの例
課題
Terminal-Bench の Docker コンテナ内で、ファイル /app/access.log には Apache のアクセスログが入っています。異なるクライアント IP アドレス(各行の空白区切りの最初のフィールド)の数を数え、その数値だけを /app/answer.txt に保存する 1 つのコマンドを書いてください。
解答
awk '{print $1}' /app/access.log | sort -u | wc -l > /app/answer.txt
解説
awk が各ログ行の最初のフィールド(クライアント IP)を出力し、sort -u が重複を除去し、wc -l が残った一意の IP を数えて、結果を /app/answer.txt にリダイレクトします。Terminal-Bench はコンテナ内で pytest テストを実行して採点し、そのテストは /app/answer.txt を読み取り、既知の一意 IP 数と一致するか確認します。
0 24.5 49 73.5 98 2025-05-22 2025-12-24 2026-07-29 Claude Opus 4 · 43.2 · 2025-05-22 Claude Opus 4 · 43.2 · 2025-05-22 Claude Opus 4 · 43.2 · 2025-05-23 Claude Sonnet 4 · 35.5 · 2025-05-23 GLM-4.6 · 40.5 · 2025-09-30 Claude Sonnet 4.5 · 50 · 2025-09-30 Claude Opus 4.5 · 59.3 · 2025-11-25 Claude Opus 4.6 · 65.4 · 2026-02-05 Composer 2 · 61.7 · 2026-03-27 GPT-5.6 Sol (ultra mode) · 91.9 · 2026-06-26 GPT-5.6 Sol · 88.8 · 2026-06-26 GLM-5.2 (753B MoE) · 70.8 · 2026-07-08 RELAI-VCL · 76.4 · 2026-07-16 RELAI-VCL · 76.4 · 2026-07-16 RELAI-VCL · 76.4 · 2026-07-16 Meta Harness · 64.6 · 2026-07-16 Meta Harness · 64.6 · 2026-07-16 Meta Harness · 64.6 · 2026-07-16 GEPA · 66 · 2026-07-16 GEPA · 66 · 2026-07-16 GEPA · 66 · 2026-07-16 baseline agent · 58.7 · 2026-07-16 baseline agent · 58.7 · 2026-07-16 baseline agent · 58.7 · 2026-07-16 Kimi K2.6 · 73 · 2026-07-29 GPT-5.5 · 69 · 2026-07-29 Kimi K3 · 32 · 2026-07-29
Claude Opus 4 Claude Sonnet 4 GLM-4.6 Claude Sonnet 4.5 Claude Opus 4.5 Claude Opus 4.6 Composer 2 GPT-5.6 Sol (ultra mode) GPT-5.6 Sol GLM-5.2 (753B MoE) RELAI-VCL Meta Harness GEPA baseline agent Kimi K2.6 GPT-5.5 Kimi K3
タイムライン
日付 モデル スコア ソース
2026-07-29 Kimi K2.6 73.0% Fireworks AI、コスト管理用のFireworks Nexusルーティングレイヤーをリリース
2026-07-29 GPT-5.5 69.0% Fireworks AI、コスト管理用のFireworks Nexusルーティングレイヤーをリリース
2026-07-29 Kimi K3 32.0% Fireworks AI、コスト管理用のFireworks Nexusルーティングレイヤーをリリース
2026-07-16 baseline agent 58.7% RELAI-VCLの化合物最適化がTerminal-Bench 2.0で成果を上げる
2026-07-16 Meta Harness 64.6% RELAI-VCLの化合物最適化がTerminal-Bench 2.0で成果を上げる
2026-07-16 GEPA 66.0% RELAI-VCLの化合物最適化がTerminal-Bench 2.0で成果を上げる
2026-07-16 RELAI-VCL 76.4% RELAI-VCLの化合物最適化がTerminal-Bench 2.0で成果を上げる
2026-07-16 Meta Harness 64.6% RELAI-VCLは継続的学習を通じてエージェントとオプティマイザーの相乗効果を強化する
2026-07-16 RELAI-VCL 76.4% RELAI-VCLは継続的学習を通じてエージェントとオプティマイザーの相乗効果を強化する
2026-07-16 GEPA 66.0% RELAI-VCLは継続的学習を通じてエージェントとオプティマイザーの相乗効果を強化する
2026-07-16 baseline agent 58.7% RELAI-VCLは継続的学習を通じてエージェントとオプティマイザーの相乗効果を強化する
2026-07-16 RELAI-VCL 76.4% RELAI-VCLは継続的学習によるエージェント最適化の利益を複合させる
2026-07-16 Meta Harness 64.6% RELAI-VCLは継続的学習によるエージェント最適化の利益を複合させる
2026-07-16 GEPA 66.0% RELAI-VCLは継続的学習によるエージェント最適化の利益を複合させる
2026-07-16 baseline agent 58.7% RELAI-VCLは継続的学習によるエージェント最適化の利益を複合させる
2026-07-08 GLM-5.2 (753B MoE) 70.8% GLM-5.2 4bitモデルを4台のDGX Sparkで実行し、Terminal-Bench 2.1で70.8%を達成
2026-06-26 GPT-5.6 Sol (ultra mode) 91.9% OpenAI、コーディング記録を達成したGPT-5.6 Solをソフトローンチしたが不正行為の問題を認める
2026-06-26 GPT-5.6 Sol 88.8% OpenAI、コーディング記録を達成したGPT-5.6 Solをソフトローンチしたが不正行為の問題を認める
2026-03-27 Composer 2 61.7pts Cursor、エージェント型コーディングモデルのトレーニングに関するComposer 2技術レポートを公開
2026-02-05 Claude Opus 4.6 65.4% Anthropicが1Mコンテキストウィンドウとエージェント機能の改善を備えたClaude Opus 4.6をリリース
2025-11-25 Claude Opus 4.5 59.3% AnthropicがClaude Opus 4.5をリリース、最先端のコーディングとコンピュータ操作を実現
2025-09-30 GLM-4.6 40.5% 智譜AI、エージェント機能と128kコンテキストウィンドウを備えたGLM-4.6をリリース
2025-09-30 Claude Sonnet 4.5 50.0% AnthropicがClaude Sonnet 4.5をリリース、コーディングとエージェント機能が強化
2025-05-23 Claude Sonnet 4 35.5% Anthropicがハイブリッド推論機能を備えたClaude Opus 4およびSonnet 4をリリース
2025-05-23 Claude Opus 4 43.2% Anthropicがハイブリッド推論機能を備えたClaude Opus 4およびSonnet 4をリリース
2025-05-22 Claude Opus 4 43.2% AnthropicがClaude Opus 4とSonnet 4を、拡張思考とツール使用機能付きで発表
2025-05-22 Claude Opus 4 43.2% AnthropicがClaude Opus 4およびSonnet 4をASL-3の安全対策付きでリリース