Выпуск llama.cpp b11224 устраняет некорректные результаты вычислений в бэкенде Vulkan, когда операции умножения матриц считывают срезы больших тензоров со страйдом, таких как KV кэши.
- Шаг батча для тензоров src0 и src1 на месте теперь корректно выводится из nb[2], а не ne00*ne01, обеспечивая правильный доступ к строкам во всех заголовках.
- Диапазоны A и B на месте задаются по их страйдированному размеру с использованием ggml_nbytes или ggml_vk_subbuffer, чтобы предотвратить чтение обнуленных данных или зависание на оборудовании NVIDIA без coopmat2.
- Пути mul_mat_id и mul_mm обновлены для корректной обработки страйдированных представлений экспертов и частичных тайлов, избегая зависаний при операциях NVFP4.
Это исправление обеспечивает точные результаты вывода для механизмов самовнимания декодера, которые полагаются на страйдированные макеты памяти в бэкенде Vulkan.