Hugging FaceのTransformersライブラリは、基盤となるggmlカーネルを活用してllama.cppに近いパフォーマンスを実現しつつ、GGUF量子化モデルの読み込みをサポートするようになりました。この統合により、開発者は対応ハードウェア上で標準的なPyTorchベースのAPI内で量子化済みチェックポイントを直接実行できます。

  • 互換性は当初、Apple Silicon向けのローカル推論に焦点を当てており、Qwen3.5アーキテクチャから開始されます。
  • 実装は新しいkernelsライブラリを通じてggml Metalカーネルを再利用し、generate関数のオーバーヘッドを削減します。
  • ユーザーは追加設定なしでfrom_pretrainedにHubモデルIDとファイル名を渡すことでGGUFモデルを読み込めます。
  • transformers serveコマンドは、これらのモデルを提供するためのOpenAI互換APIを公開しています。
  • MacBook Pro M2 Maxでのベンチマークでは、Transformersが密なチェックポイントとMixture-of-Expertsチェックポイントの両方でllama.cppに近いパフォーマンスを示しました。

この統合により、Transformersのモデル定義基盤はllama.cppのローカル推論基盤に近づき、開発者はおなじみのPyTorchツールを使用して検査、評価、ファインチューニングを行う際にGGUFモデルを実験できるようになります。