llama.cppプロジェクトはビルドb10369をリリースし、pocket-tts テキスト読み上げモデルのサポートを導入しました。このアップデートには、パフォーマンスを最適化するためにGEMMとcol2imを使用した転置畳み込みの新しい実装が含まれています。
- 以前のバージョンと比較して、CUDA上でのフレームごとの生成時間が80%短縮され、CPU上では50%短縮されます。
- 出力は参照実装と相関0.999994で一致し、フレーム数も同一です。
- 言語パックは新しいmmprojキーを通じて、音声終了パディングと短いプロンプトパディングを調整するようになりました。
- フランス語の長文テストでは、参照時間(22.96秒)に対して2%以内の生成時間(23.44秒)となりました。
この最適化は忠実度を維持しつつ音声合成を大幅に高速化し、既存のmmprojファイルは新しい設定キーを含むように変換する必要があります。