Проект llama.cpp выпустил версию b10538, внедряющую ключевую оптимизацию в бэкенд metal. Это обновление позволяет деquantизировать кэш ключей и значений (KV) исключительно для больших размеров батчей.
- Основное изменение касается бэкенда metal, который теперь применяет деquantизированный KV-кэш только при обработке больших батчей.
- Бинарные файлы доступны для macOS (Apple Silicon и Intel), iOS, Linux (CPU, Vulkan, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm) и openEuler.
Поддержка KleidiAI на Apple Silicon для macOS и ROCm 7.14 на Ubuntu отключена в этом выпуске.
Эта оптимизация направлена на улучшение эффективности использования памяти или производительности для рабочих нагрузок с большими размерами батчей на совместимом оборудовании.