O projeto llama.cpp lançou a build b10093, que inclui atualizações específicas para suportar os modelos DeepSeek v4. O lançamento aborda o tratamento de templates e introduz novas flags de configuração para esta família de modelos.

  • Corrige o template crafted do DeepSeek v4 para seguir explicitamente o comportamento de referência.
  • Adiciona suporte à flag `drop_reasoning` do DeepSeek v4.
  • Conecta o parser do DeepSeek 3.2 para também lidar com entradas do DeepSeek v4.
  • Inclui uma correção para a reordenação de resultados de ferramentas.

Esta atualização garante a formatação correta do chat e o tratamento de tokens de raciocínio para os modelos DeepSeek v4 dentro do llama.cpp.