llama.cpp バージョン b9731 は、トークンソートオーバーヘッドを削減するために std::partial_sort を使用した最適化を導入し、top-n トークン選択のパフォーマンスを 8.555ms から 0.704ms に改善しました。このリリースには、macOS、Linux、Android、Windows、openEuler 向けのプリビルドバイナリが含まれており、複数のアーキテクチャとハードウェアアクセラレーションオプションに対応しています。