一位用户在 SWE-bench Verified-Mini 数据集上对 Ox Alpha 模型进行了基准测试,使用官方的 mini-swe-agent 框架实现了 96% 的解决率(50 个任务中的 48 个)。评估在本地通过官方的 SWE-bench Docker 工具链进行,只有当所有 FAIL_TO_PASS 和 PASS_TO_PASS 测试都通过时,才认为任务已解决。

  • 模型:Ox Alpha,通过 opencode 的 Go 网关提供服务。
  • 框架:mini-swe-agent v2.4.6(仅 Bash 的官方排行榜框架)。
  • 数据集:swe-bench-verified-mini,一个仅包含 django 和 sphinx 仓库的 50 个任务的子集。
  • 结果:解决了 48/50 个任务,失败案例为 django__django-11790 和 django__django-11815;每个任务平均需要 40 步。
  • 对比:该分数超过了 Claude Fable 5 在同一子集上取得的 95%,尽管作者指出这可能是因为记忆效应或数据集更小、更简单而导致的高估。

作者认为这一结果对于免费层模型来说高得可疑,并建议将 96% 的数值视为上限,而不是与在完整 500 个任务集上测试的模型进行比较的基准。