Proyek llama.cpp merilis versi b10984, memperkenalkan dukungan CUDA untuk operasi SUM_ROWS baris-kontigu. Pembaruan ini juga mengatur kode untuk menyertakan GGML_OP_MEAN guna menangani tensor baris-kontigu melalui kernel bersama.
- Menambahkan dukungan CUDA untuk SUM_ROWS baris-kontigu.
- Mengatur kode untuk menambahkan GGML_OP_MEAN untuk tensor baris-kontigu menggunakan kernel bersama.
- Menyertakan tes untuk operasi permutasi dan iris MEAN.
- Menyediakan biner untuk macOS, Linux, Windows, Android, dan openEuler di seluruh backend CPU, CUDA, Vulkan, ROCm, OpenVINO, dan SYCL.
Rilis ini memastikan kompatibilitas dengan berbagai akselerator perangkat keras dan sistem operasi untuk inferensi lokal.