Benchmark · agentic
DeepSWE
DataCurve's long-horizon real-repo coding-agent suite (headline metric = pass@1 resolve rate); Artificial Analysis swapped SWE-bench Pro out of its Coding Agent Index for it. Not a SWE-bench variant.
| التاريخ | النموذج | النتيجة | المصدر |
|---|---|---|---|
| 2026-07-27 | GPT-5.6 Sol | 72.7% | كيمي K3 يتفوق على جي بي تي-5.6 سول في DeepSWE pass@4 ويقلل التكلفة بنسبة 64% |
| 2026-07-27 | Kimi K3 | 68.5% | كيمي K3 يتفوق على جي بي تي-5.6 سول في DeepSWE pass@4 ويقلل التكلفة بنسبة 64% |