Выпуск llama.cpp b10236 представляет реализацию Metal для DSv4 Lightning Indexer, специально поддерживающую входные данные размерностью 128 с запросами и весами F32, а также ключами и масками F16.
- Обновление включает тайловые и хвостовые ядра для обработки длин KV вблизи границ 8 и 64 элементов.
- K тайлы загружаются и декодируются в памяти threadgroup F16 перед загрузкой матриц simdgroup, поддерживая форматы F32, F16, BF16 и различные форматы квантования.
- Бенчмарки показывают улучшенную пропускную способность префиллинга (pp512) при длинах последовательностей 10k, 20k и 30k токенов по сравнению с предыдущими версиями.
Эта оптимизация улучшает производительность вывода на устройствах Apple Silicon за счёт улучшения шаблонов доступа к памяти для Lightning Indexer.