llama.cppプロジェクトはバージョン0.5.0をリリースし、バックエンドのパフォーマンス、より広範なモデル対応、そしてより堅牢なサーバー運用に焦点を当てています。このアップデートでは、HRM-Text (DFM Mimir 1B) や MiMo-V2.6 といった新しいアーキテクチャのサポートを導入し、CUDA および Metal の最適化を通じて計算効率を大幅に向上させました。
- 暗黙的 GEMM を使用して CUDA conv2d 操作を高速化。
- Metal MoE および SSM_CONV の融合最適化を追加。
- コンマ区切りの TCP アドレスと UNIX ソケット経由でサーバーが複数のアドレスにバインドできるようにしました。
- input_image サポートを追加することで、関数呼び出しからの画像出力を有効化。
- ggml を v0.25.0 に更新し、バックエンド全体でハイパー接続およびフラッシュアテンションのサポートを拡大。
今回のリリースでは、ルーターによって生成された子プロセスの安定性が向上し、いくつかのチャットパーサーの問題が修正され、llama.cpp を本番環境でデプロイするユーザーにとってより信頼性の高い運用が保証されました。