La versión b10666 de llama.cpp amplía el conjunto de pruebas de guardado/carga de estado para ejecutarse en todas las arquitecturas y resuelve varios errores críticos en la gestión del estado y el manejo del grafo. Los cambios clave incluyen corregir referencias colgantes en minimax-01, alinear la copia de fragmentos para secuencias en el dispositivo y corregir los conteos de cabezales del indexador para deepseek4.
- El conjunto de pruebas de guardado/carga de estado ahora se ejecuta contra todos los modelos *.gguf mediante un nuevo modo --models DIR, reemplazando la limitación anterior de un solo modelo.
- La lógica de copia de secuencia de estado en el dispositivo se relajó para manejar fuentes no contiguas utilizando un cursor de bytes en lugar de requerir una alineación exacta de fragmentos.
- Los parámetros del indexador DSA ficticio se actualizaron (key_length=128, head_count=64) para asegurar que la operación Lightning Indexer fusionada se ejecute en la GPU en lugar de retroceder a la CPU.
- El conteo de cabezales del indexador de deepseek4 se estableció en 64 para coincidir con los requisitos del kernel corregido, evitando advertencias de incompatibilidad de dispositivo.
- Una referencia hparams colgante en la entrada del grafo LA de minimax-01 se reemplazó con una copia para prevenir la corrupción de memoria de pila durante la reutilización del grafo.
Estas actualizaciones mejoran la cobertura de pruebas y la estabilidad para arquitecturas complejas como deepseek4, gemma2 y minimax-01, asegurando que la serialización del estado funcione correctamente en diversos backends de hardware.