llama.cpp バージョン 0.4.0 は、Qwen3.8-Flash-Next および NVIDIA Nemotron-3-Puzzle-75B-A9B モデルの初期アーキテクチャ サポートを導入し、基盤となる ggml ライブラリをバージョン 0.23.0 にアップグレードしました。

  • オンデマンドの遅延テンソル読み込みとスロットごとのサーバー コンテキスト制限を追加。
  • ggml を 0.23.0 に更新し、スパース フラッシュ アテンションおよび Apple RDMA トランスポート サポートに対応。
  • ビデオ入力オプション、n-gram 履歴の検索、量子化器の RAM カップルを導入。
  • サーバーで `preserve_reasoning` をデフォルトで有効にし、マルチモーダル トークン化ヘルパーを改善。

これらの変更によりモデルの互換性が拡大し、開発者はメモリ使用量とサーバー リソースの割り当てに対してより細かな制御を行えるようになります。