一位用户开发了自定义实现,允许 DeepSeek V4.1 模型在 NVIDIA A100 GPU 上运行,其性能超过了官方 API。
- 该项目可通过 GitHub 仓库 shi3z/deepseekv4.1-A100-custom 获取。
- 这一成就值得注意,因为 A100 硬件原生不支持 FP4 精度,而此类优化通常需要该精度。
- 与标准的官方 API 端点相比,自定义代码实现了更快的推理速度。
一位用户开发了自定义实现,允许 DeepSeek V4.1 模型在 NVIDIA A100 GPU 上运行,其性能超过了官方 API。