llama.cpp b10236 रिलीज़ में DSv4 Lightning Indexer का एक Metal कार्यान्वयन पेश किया गया है, जो विशेष रूप से 128-आयामी इनपुट को F32 क्वेरीज और वेट्स के साथ और F16 कीज़ और मास्क के साथ सपोर्ट करता है।
- अपडेट में 8- और 64-तत्व सीमाओं के पास KV लंबाई को संभालने के लिए टाइल्ड और टेल कर्नेल शामिल हैं।
- K टाइल्स को simdgroup मैट्रिक्स लोड से पहले F16 थ्रेडग्रुप मेमोरी में स्टेज और डीक्वांटाइज़ किया जाता है, जो F32, F16, BF16 और विभिन्न क्वांटीकरण फॉर्मेट्स का समर्थन करता है।
- बेंचमार्क पिछले संस्करणों की तुलना में 10k, 20k और 30k टोकन की अनुक्रम लंबाई पर प्रीफिल थ्रूपुट (pp512) में सुधार दिखाते हैं।
यह अनुकूलन Lightning Indexer के लिए मेमोरी एक्सेस पैटर्न को बेहतर बनाकर Apple Silicon डिवाइसों पर इनफरेंस प्रदर्शन को बढ़ाता है।