Проект llama.cpp выпустил версию b11335, включающую оптимизацию CUDA для GPU Volta. Обновление перенаправляет архитектуру sm_70 в существующую таблицу nwarps Turing MMVQ вместо перехода к общей конфигурации.

  • Volta (sm_70) теперь использует настройку TURING для декодирования K-quant batch-1, изменяя количество варпов с 4 до 2.
  • Тесты на Tesla V100 с Qwen3.8-27B показывают увеличение пропускной способности на +3.17% (+1.091 t/s) при идентичном битовому представлению перплексити.
  • Изменение основано на форке anyei/llamacpp-v100 и применяется к селекторам таблиц устройства и хоста.

Эта настройка ускоряет вывод на оборудовании Volta, не влияя на точность модели.