Релиз llama.cpp b10255 расширяет путь oneDNN SDPA для поддержки не-FP16 ключ-значения (KV) кэшей, включая форматы квантования Q4_0–Q8_0 и FP32. Это обновление позволяет слитому систолическому ядру выполняться идентично нативному пути FP16 за счёт деквантования или преобразования тензоров K/V в плотный FP16 на устройстве перед обработкой.

  • Поддерживаемые типы KV включают Q4_0, Q4_1, Q5_0, Q5_1, Q8_0 и F32, тогда как BF16 и IQ типы исключены из-за отсутствия ядер преобразования.
  • Поддержка не-FP16 ограничена требованиями K >= 1024 и Q >= 32 в фазе prefill.
  • В релиз включено исправление синхронизации потоков, обеспечивающее безусловное поведение wait_and_throw, и удалено псевдонимирование V_is_K_view для обеспечения того, чтобы K и V всегда деквантовались в отдельные буферы.
  • Бинарные файлы предоставляются для macOS, Linux, Windows, Android и openEuler на CPU, GPU (CUDA, Vulkan, ROCm, OpenCL) и специализированных бэкендах, таких как SYCL и OpenVINO.