Proyek llama.cpp merilis versi b10355, memperkenalkan dukungan untuk pengambilan sampel backend multi-output. Pembaruan ini memungkinkan pengambilan sampel backend dikombinasikan dengan spekulasi token dan menambahkan parameter konteks numerik untuk mendeklarasikan jumlah output maksimum per sekuens.

  • Aktifkan pengambilan sampel backend dengan spekulasi token
  • Clamp jumlah mask sebelum mengubahnya menjadi indeks yang diambil sampelnya
  • Tambahkan parameter konteks numerik yang mendeklarasikan output maksimum satu sekuens
  • Perbaiki ketidakcocokan antara pengambilan sampel CPU dan backend, serta samakan dist antara CPU dan GPU
  • Sederhanakan perubahan dan perbaiki tes pada Vulkan

Rilis ini menyediakan biner untuk macOS, iOS, Linux, Android, Windows, dan openEuler di berbagai backend perangkat keras termasuk CPU, CUDA, ROCm, OpenVINO, SYCL, HIP, dan Vulkan.