あるユーザーが、DeepSeek V4.1モデルをNVIDIA A100 GPUで実行し、公式APIを上回るパフォーマンスを実現するカスタム実装を開発しました。
- このプロジェクトはGitHubリポジトリ shi3z/deepseekv4.1-A100-custom で公開されています。
- この成果が注目されるのは、A100ハードウェアが通常このような最適化に必要なFP4精度をネイティブにサポートしていないためです。
- カスタムコードにより、標準の公式APIエンドポイントと比較してより高速な推論速度が可能になります。