Proyek llama.cpp telah merilis versi b10313, yang memperkenalkan penjadwal Least Recently Used (LRU) untuk komponen servernya. Pembaruan ini mencakup penanganan penggabungan permintaan dan perbaikan untuk kasus streaming.
- Server sekarang mendukung penjadwal LRU untuk mengelola koneksi.
- Logika penggabungan permintaan diimplementasikan untuk menangani keluar dari antrean tunggu.
- Tes telah ditambahkan untuk memverifikasi perilaku penjadwalan baru.
- Sebuah bug yang mempengaruhi kasus stream telah diperbaiki.
Rilis ini menyediakan biner yang diperbarui untuk macOS, Linux, Windows, Android, dan iOS di berbagai backend perangkat keras termasuk CPU, CUDA, Vulkan, ROCm, dan OpenVINO.