Rilis llama.cpp b10236 memperkenalkan implementasi Metal dari DSv4 Lightning Indexer, secara khusus mendukung input berdimensi 128 dengan kueri dan bobot F32 serta kunci dan mask F16.
- Pembaruan ini mencakup kernel bertile dan ekor untuk menangani panjang KV di dekat batas elemen 8 dan 64.
- Tile K ditahankan dan didekuantisasi dalam memori grup thread F16 sebelum pemuatan matriks simdgroup, mendukung format F32, F16, BF16, dan berbagai format kuantisasi.
Benchmark menunjukkan peningkatan throughput prefill (pp512) pada panjang urutan 10k, 20k, dan 30k token dibandingkan versi sebelumnya.
Optimasi ini meningkatkan kinerja inferensi pada perangkat Apple Silicon dengan memperbaiki pola akses memori untuk Lightning Indexer.