あるユーザーが、DeepSeek V4.1モデルをNVIDIA A100 GPUで実行し、公式APIを上回るパフォーマンスを実現するカスタム実装を開発しました。

  • このプロジェクトはGitHubリポジトリ shi3z/deepseekv4.1-A100-custom で公開されています。
  • この成果が注目されるのは、A100ハードウェアが通常このような最適化に必要なFP4精度をネイティブにサポートしていないためです。
  • カスタムコードにより、標準の公式APIエンドポイントと比較してより高速な推論速度が可能になります。