Релиз llama.cpp b10666 расширяет набор тестов save-load-state для запуска на всех архитектурах и устраняет несколько критических ошибок в управлении состоянием и обработке графа. Ключевые изменения включают исправление висячих ссылок в minimax-01, согласование копирования чанков для последовательностей на устройстве и исправление количества голов индексатора для deepseek4.
- Набор тестов save-load-state теперь запускается против каждой модели *.gguf через новый режим --models DIR, заменяя предыдущее ограничение одной модели.
- Логика копирования состояния последовательности на устройстве была ослаблена для обработки неконтекстных источников путем использования байтового курсора вместо требования точного выравнивания чанков.
- Параметры фиктивного индексатора DSA были обновлены (key_length=128, head_count=64), чтобы гарантировать, что слитая операция Lightning Indexer выполняется на GPU, а не откатывается к CPU.
- Количество голов индексатора deepseek4 установлено в 64 для соответствия требованиям исправленного ядра, предотвращая предупреждения о несоответствии устройства.
- Висящая ссылка hparams во входных данных графа LA модели minimax-01 была заменена на копию для предотвращения повреждения памяти стека при повторном использовании графа.
Эти обновления улучшают покрытие тестами и стабильность для сложных архитектур, таких как deepseek4, gemma2 и minimax-01, гарантируя правильную сериализацию состояния на различных аппаратных бэкендах.