Proyek llama.cpp merilis versi b11335, yang mencakup optimasi CUDA untuk GPU Volta. Pembaruan ini mengarahkan arsitektur sm_70 ke tabel nwarps Turing MMVQ yang ada alih-alih jatuh ke konfigurasi generik.

  • Volta (sm_70) sekarang menggunakan penyetelan TURING untuk decoding batch-1 K-quant, mengubah jumlah warp dari 4 menjadi 2.
  • Benchmark pada Tesla V100 dengan Qwen3.8-27B menunjukkan peningkatan throughput sebesar +3.17% (+1.091 t/s) dengan perplexitas yang identik secara bit.
  • Perubahan ini berasal dari fork anyei/llamacpp-v100 dan berlaku untuk pemilih tabel perangkat dan host.

Penyesuaian ini meningkatkan kecepatan inferensi pada perangkat keras Volta tanpa memengaruhi akurasi model.