Proyek llama.cpp merilis versi b10951, yang mencakup optimisasi kode dalam logika dekoding. Panggilan fungsi `llama_n_rs_seq` sekarang dieksekusi sebelum `llama_decode`, memungkinkan sistem langsung kembali jika pemeriksaan berhasil.

  • Perubahan ini menghilangkan kebutuhan untuk mengatur variabel `res` dan menggunakan pernyataan goto ketika kondisi pengembalian dini terpenuhi.
  • Motivasi utamanya adalah menghindari pemanggilan `llama_decode` ketika tidak diperlukan, meningkatkan efisiensi.
  • Biner tersedia untuk macOS (Apple Silicon dan Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), dan openEuler.