llama.cpp プロジェクトはビルド b10649 をリリースし、合成推測受容の新しい機能を導入しました。この追加はベンチマーキング目的のために特別に設計されており、llama-server と llama-cli の両方のコンポーネントで利用可能です。

  • llama-server と llama-cli にベンチマーク専用の合成推測受容を追加。
  • CPU、GPU、および各種アクセラレータバックエンドに対応する macOS、iOS、Linux、Windows、Android、openEuler のバイナリを含みます。
  • このビルドでは macOS Apple Silicon での KleidiAI サポートを無効化しました。

このリリースは幅広いプラットフォーム向けの更新されたバイナリを提供し、推測デコーディングのパフォーマンスを評価するための特定のツールを追加しています。