一位用户通过运行 34 个单样本提示并评估生成的 HTML、截图和 GIF,将 Kimi K3 与 Claude Opus 4.8 进行了对比评估。评估结论是 Kimi K3 产生的结果优于 Opus 4.8。

  • Kimi K3 在 34 个单样本提示上进行了测试,输出结果由 Sonnet 4.6 评估。
  • 与 Claude Opus 4.8 相比,该模型在生成 HTML、截图和 GIF 方面表现出更优越的性能。
  • Kimi K3 处理整套提示的成本为 $0.44,远低于 Opus 4.8 的 $7.16。

结果表明,Kimi K3 不仅在单样本生成任务中更有效,而且与竞争对手模型相比,具有更高的令牌效率和成本效益。