O projeto llama.cpp lançou a versão b10254, introduzindo um novo modelo de chat para o modelo DeepSeek V4 Flash 0731 junto com atualizações nos templates existentes do DeepSeek V4.

  • Alinha os templates DeepSeek V4 aos codificadores oficiais, excluindo mudanças no comportamento do parser.
  • Por padrão, descarta o histórico de raciocínio para DeepSeek V4, a menos que preserve_reasoning seja solicitado ou ferramentas estejam presentes.
  • Adiciona instruções de formato de resposta para saída estruturada e passa esquemas para a renderização do template.
  • Introduz um template Flash 0731 separado para lidar com os mapeamentos atualizados de esforço de raciocínio alto e máximo.
  • Inclui correções para o consumo do separador de chamadas de ferramentas do parser DSML e seleção do template deepseek v4 0731.

Esta atualização garante compatibilidade com as últimas especificações do modelo DeepSeek e melhora o tratamento de saída estruturada.