O projeto llama.cpp lançou a compilação b10737, que corrige bugs críticos no suporte à arquitetura qwen4exp. A atualização resolve problemas com a persistência do estado da sequência e evita abortos de CUDA durante o carregamento do modelo.
- Corrige o colapso NaN em kvu e restaura os dados do cache indexador ext.x/ext.y durante as operações de salvamento/restauração para modelos qwen4exp.
- Corriga a derivação da contagem de linhas per_layer_token_embd e rejeita desreferências de ponteiro nulo nas camadas de cache recorrente PLE.
- Desativa a flag -sm tensor para qwen4exp, que anteriormente causava logits NaN e falhas em dispositivos reais.
- Renomeia seq_set para seq_get_all para resolver conflitos de sobrecarga de função e adiciona testes que verificam a integridade do estado.
Essas alterações garantem que os modelos qwen4exp possam ser carregados e salvos sem corrupção de dados ou erros de tempo de execução, especialmente ao usar conteúdo mrope 2D ou camadas PLE.