O lançamento llama.cpp b10666 expande o conjunto de testes de salvamento/carregamento de estado para executar em todas as arquiteturas e resolve vários bugs críticos no gerenciamento de estado e manipulação de grafos. As principais alterações incluem a correção de referências pendentes no minimax-01, alinhamento da cópia de blocos para sequências no dispositivo e correção das contagens de cabeçalho do indexador para deepseek4.

  • O conjunto de testes de salvamento/carregamento de estado agora é executado contra todos os modelos *.gguf por meio de um novo modo --models DIR, substituindo a limitação anterior de modelo único.
  • A lógica de cópia de sequência de estado no dispositivo foi flexibilizada para lidar com fontes não contíguas, usando um cursor de bytes em vez de exigir alinhamento exato de blocos.
  • Os parâmetros do indexador DSA fictício foram atualizados (key_length=128, head_count=64) para garantir que a operação Lightning Indexer fundida seja executada na GPU em vez de cair no fallback para CPU.
  • A contagem de cabeçalho do indexador do deepseek4 foi definida como 64 para atender aos requisitos fixos do kernel, evitando avisos de incompatibilidade de dispositivo.
  • Uma referência hparams pendente na entrada do grafo LA do minimax-01 foi substituída por uma cópia para prevenir corrupção de memória da pilha durante a reutilização do grafo.

Essas atualizações melhoram a cobertura de testes e a estabilidade para arquiteturas complexas como deepseek4, gemma2 e minimax-01, garantindo que a serialização de estado funcione corretamente em diversos backends de hardware.