Um usuário desenvolveu uma implementação personalizada que permite que o modelo DeepSeek V4.1 seja executado em GPUs NVIDIA A100 com desempenho superior ao da API oficial.

  • O projeto está disponível no repositório do GitHub shi3z/deepseekv4.1-A100-custom.
  • Esta conquista é notável porque o hardware A100 não suporta nativamente a precisão FP4, que é tipicamente necessária para tais otimizações.
  • O código personalizado permite velocidades de inferência mais rápidas em comparação com o endpoint oficial padrão.