LLaMA.cpp merilis versi b9729 dengan binari untuk macOS, Linux, Android, Windows, dan openEuler di berbagai arsitektur. Rilis ini mencakup dukungan CPU, Vulkan, OpenVINO, SYCL, dan ROCm, serta paket UI baru. Referensi internal ke 'webui' telah dihapus.
LLaMA.cpp Rilis b9729: Binari Baru dan Dukungan Platform
llama.cpp Rilis b9741 Menambahkan Binari Baru dan Dukungan
Versi llama.cpp b9741 memperkenalkan binari baru untuk macOS, Linux, Android, Windows, dan openEuler di berbagai arsitektur. Rilis ini mencakup dukungan untuk Vulkan, CUDA 12.4 dan 13.3, OpenVINO, SYCL, dan ROCm, dengan versi yang diperbarui untuk iOS dan Ubuntu.
ggml mengoptimalkan AMX dengan flattening partisi
Proyek ggml telah mengoptimalkan kinerja AMX dengan melakukan flattening pada partisi atas n_batch * M, memastikan semua thread berpartisipasi dalam kuantisasi. Perubahan ini meningkatkan kecepatan hingga 1.47x di berbagai model dan konfigurasi perangkat keras pada platform CPU dan GPU, dengan hasil menunjukkan peningkatan konsisten dalam waktu inferensi.
ggml-webgpu Menambahkan Toggle Adapter F16 untuk Vulkan dan NVIDIA
Proyek ggml-webgpu telah menambahkan toggle adapter untuk dukungan presisi setengah (F16) pada GPU Vulkan dan NVIDIA. Pembaruan ini mengaktifkan kinerja yang lebih baik pada perangkat keras yang kompatibel di berbagai platform, termasuk macOS, Linux, Android, Windows, dan openEuler, dengan build khusus tersedia untuk arsitektur ARM dan x64.
llama.cpp Release b9703: Pembaruan dan Unduhan Biner
llama.cpp versi b9703 mencakup penataan ulang penanganan preset server, menghapus dukungan preset HF jarak jauh dan fungsi yang sudah usang. Rilis ini menyediakan biner untuk macOS, Linux, Android, Windows, dan openEuler di berbagai arsitektur dan opsi akselerasi perangkat keras, termasuk Vulkan, CUDA, OpenVINO, dan SYCL.
Backend Metal menambahkan dukungan f16 dan bf16 untuk operator concat
Backend Metal di llama.cpp telah diperluas untuk mendukung tipe tensor f16 dan bf16 untuk operator concat, selain dukungan f32 dan i32 yang sudah ada. Pembaruan ini mencakup template kernel khusus, getter pipeline yang diperbarui, dan dispatch kernel berbasis tipe yang ditingkatkan, dengan bantuan dari pi:llama.cpp/Qwen3.6-27B.