llama.cppプロジェクトはバージョン0.5.0をリリースし、バックエンドのパフォーマンス、より広範なモデル対応、そしてより堅牢なサーバー運用に焦点を当てています。このアップデートでは、HRM-Text (DFM Mimir 1B) や MiMo-V2.6 といった新しいアーキテクチャのサポートを導入し、CUDA および Metal の最適化を通じて計算効率を大幅に向上させました。

  • 暗黙的 GEMM を使用して CUDA conv2d 操作を高速化。
  • Metal MoE および SSM_CONV の融合最適化を追加。
  • コンマ区切りの TCP アドレスと UNIX ソケット経由でサーバーが複数のアドレスにバインドできるようにしました。
  • input_image サポートを追加することで、関数呼び出しからの画像出力を有効化。
  • ggml を v0.25.0 に更新し、バックエンド全体でハイパー接続およびフラッシュアテンションのサポートを拡大。

今回のリリースでは、ルーターによって生成された子プロセスの安定性が向上し、いくつかのチャットパーサーの問題が修正され、llama.cpp を本番環境でデプロイするユーザーにとってより信頼性の高い運用が保証されました。