llama.cppプロジェクトはバージョンb10355をリリースし、マルチ出力バックエンドサンプリングのサポートを導入しました。このアップデートにより、バックエンドサンプリングとトークン推測を組み合わせて有効にし、シーケンスあたりの最大出力数を宣言するための数値コンテキストパラメータが追加されました。
- トークン推測付きのバックエンドサンプリングを有効化
- サンプリングされたインデックスに変換する前にマスクの合計をクランプ
- 1つのシーケンスに対する最大出力数を宣言する数値コンテキストパラメータを追加
- CPUとバックエンドサンプリングの不整合を修正し、CPUとGPU間の分布(dist)を一致させる
- 変更を簡素化し、Vulkan上のテストを修正
リリースでは、CPU、CUDA、ROCm、OpenVINO、SYCL、HIP、Vulkanを含むさまざまなハードウェアバックエンド向けに、macOS、iOS、Linux、Android、Windows、openEuler用のバイナリが提供されます。