O lançamento llama.cpp b10666 expande o conjunto de testes de salvamento/carregamento de estado para executar em todas as arquiteturas e resolve vários bugs críticos no gerenciamento de estado e manipulação de grafos. As principais alterações incluem a correção de referências pendentes no minimax-01, alinhamento da cópia de blocos para sequências no dispositivo e correção das contagens de cabeçalho do indexador para deepseek4.
- O conjunto de testes de salvamento/carregamento de estado agora é executado contra todos os modelos *.gguf por meio de um novo modo --models DIR, substituindo a limitação anterior de modelo único.
- A lógica de cópia de sequência de estado no dispositivo foi flexibilizada para lidar com fontes não contíguas, usando um cursor de bytes em vez de exigir alinhamento exato de blocos.
- Os parâmetros do indexador DSA fictício foram atualizados (key_length=128, head_count=64) para garantir que a operação Lightning Indexer fundida seja executada na GPU em vez de cair no fallback para CPU.
- A contagem de cabeçalho do indexador do deepseek4 foi definida como 64 para atender aos requisitos fixos do kernel, evitando avisos de incompatibilidade de dispositivo.
- Uma referência hparams pendente na entrada do grafo LA do minimax-01 foi substituída por uma cópia para prevenir corrupção de memória da pilha durante a reutilização do grafo.
Essas atualizações melhoram a cobertura de testes e a estabilidade para arquiteturas complexas como deepseek4, gemma2 e minimax-01, garantindo que a serialização de estado funcione corretamente em diversos backends de hardware.