Benchmark · agentic

DeepSWE

2 परिणाम 2 मॉडल

DataCurve's long-horizon real-repo coding-agent suite (headline metric = pass@1 resolve rate); Artificial Analysis swapped SWE-bench Pro out of its Coding Agent Index for it. Not a SWE-bench variant.

0 19.5 39 58.5 78 2026-07-27 GPT-5.6 Sol · 72.7 · 2026-07-27 Kimi K3 · 68.5 · 2026-07-27
GPT-5.6 Sol Kimi K3
समयरेखा
तारीख़ मॉडल स्कोर स्रोत
2026-07-27 GPT-5.6 Sol 72.7% Kimi K3 ने DeepSWE pass@4 पर GPT-5.6 Sol को हराया और लागत 64% कम की
2026-07-27 Kimi K3 68.5% Kimi K3 ने DeepSWE pass@4 पर GPT-5.6 Sol को हराया और लागत 64% कम की