一位用户开发了自定义实现,允许 DeepSeek V4.1 模型在 NVIDIA A100 GPU 上运行,其性能超过了官方 API。

  • 该项目可通过 GitHub 仓库 shi3z/deepseekv4.1-A100-custom 获取。
  • 这一成就值得注意,因为 A100 硬件原生不支持 FP4 精度,而此类优化通常需要该精度。
  • 与标准的官方 API 端点相比,自定义代码实现了更快的推理速度。