Proyek vLLM merilis versi 0.29.0, yang mencakup perbaikan bug inti terkait cache prefix padat.
- Pembaruan ini menerapkan pengaturan default cache prefix padat secara khusus untuk model hibrida.
Proyek vLLM merilis versi 0.29.0, yang mencakup perbaikan bug inti terkait cache prefix padat.
Proyek llama.cpp merilis versi b10891, yang mengatasi masalah stabilitas kritis pada GPU PowerVR. Pembaruan ini memodifikasi backend Vulkan agar kembali ke reduksi memori bersama untuk operasi perkalian matriks-vektor dekuantisasi (dmmv).
DeepSeek AI telah merilis DeepSeek-V4.1-Flash, sebuah model Mixture-of-Experts multimodal yang dilengkapi jendela konteks 1 juta token dan cache KV FP4 yang mengurangi jejak cache global menjadi 890 byte per token. Model ini memanfaatkan arsitektur encoder-decoder kausal dan Compressed Sparse Attention 2 (CSA2) untuk secara signifikan menurunkan kebutuhan memori sambil mempertahankan kinerja.
Proyek llama.cpp telah merilis build b10889, yang mencakup optimasi memori untuk menghindari alokasi cache V untuk indexer karena tidak digunakan.
Proyek llama.cpp telah merilis build b10888, yang mencakup fitur baru untuk menambahkan label debug buffer perintah untuk profiler GPU di backend Vulkan.
Proyek llama.cpp merilis build b10886, yang memperkenalkan dukungan intrinsik vektor Q1_0 untuk arsitektur s390x. Pembaruan ini mencakup implementasi `ggml_vec_dot_q1_0_q8_0` dan memperbarui dokumentasi untuk mencerminkan kemampuan baru.
Kami menggunakan cookie untuk mengukur lalu lintas dan meningkatkan situs. Anda dapat menerima atau menolak cookie analitik. Kebijakan privasi