Релиз llama.cpp b11372 вводит оптимизации для молниеносного индексатора модели qwen4exp, прежде всего сокращая вдвое память, необходимую для вычисления оценок индекса при обработке длинного контекста. Это достигается за счёт вычисления оценок голов на месте, а не создания отдельных тензоров для каждой головы.
- Индексатор qwen4exp теперь повторно использует буферы аллокатора и вычисляет оценки через ggml_lightning_indexer для снижения пикового потребления памяти.
- Добавлена поддержка бэкенда CUDA для молниеносного индексатора с 4 головами, которые передаются в векторное ядро.
- Бэкенд Metal обновлён: теперь он считывает количество голов из константы функции, что позволяет запускать любое количество голов без изменений кода.
- Бэкенд Vulkan тайлит молниеносный индексатор по ключам и токенам с использованием общей памяти и скалярных произведений fp16.
Эти изменения повышают эффективность использования памяти для моделей qwen4exp с длинными контекстами, сохраняя размер вычислительного буфера и скорость.