llama.cpp プロジェクトはバージョン b10437 をリリースし、MiniMax-Text-01 および MiniMax-M1 因果言語モデルのネイティブサポートを導入しました。このアップデートには、llama.cpp フレームワーク内でこれらの特定のモデルを実行するために必要な変換スクリプト、チャットテンプレート、およびモデルアーキテクチャの実装が含まれています。

  • モデル層に `MiniMaxText01ForCausalLM` および `MiniMaxM1ForCausalLM` のサポートを追加。
  • サンプリングプロセスの妨害を防ぐため、ゼロ値を持つ埋め込みに対するトークン抑制を実装。
  • 状態の転置操作を削除し、簡潔な実装のために共通関数を使用することでパフォーマンスを最適化。
  • MiniMax-M1 専用の Jinja チャットテンプレートを追加。
  • CPU、GPU、および各種アクセラレータ向けに、macOS、Linux、Windows、Android、openEuler のビルドアーティファクトを含める。

このリリースにより、ユーザーは llama.cpp の既存の推論インフラストラクチャを使用して MiniMax モデルをローカルで実行できるようになります。