O projeto llama.cpp lançou a versão b10254, introduzindo um novo modelo de chat para o modelo DeepSeek V4 Flash 0731 junto com atualizações nos templates existentes do DeepSeek V4.
- Alinha os templates DeepSeek V4 aos codificadores oficiais, excluindo mudanças no comportamento do parser.
- Por padrão, descarta o histórico de raciocínio para DeepSeek V4, a menos que preserve_reasoning seja solicitado ou ferramentas estejam presentes.
- Adiciona instruções de formato de resposta para saída estruturada e passa esquemas para a renderização do template.
- Introduz um template Flash 0731 separado para lidar com os mapeamentos atualizados de esforço de raciocínio alto e máximo.
- Inclui correções para o consumo do separador de chamadas de ferramentas do parser DSML e seleção do template deepseek v4 0731.
Esta atualização garante compatibilidade com as últimas especificações do modelo DeepSeek e melhora o tratamento de saída estruturada.