MLXライブラリがバージョン0.32.1をリリースし、Metalフルアテンションの実装内に次元72のヘッドのサポートを導入しました。
- このアップデートにより、プルリクエスト#4330を通じてMetalフルアテンションで次元72のヘッドの使用が可能になりました。
MLXライブラリがバージョン0.32.1をリリースし、Metalフルアテンションの実装内に次元72のヘッドのサポートを導入しました。
Appleは第3世代ファウンデーションモデル(AFM3)用の新しいアーキテクチャを導入し、「指示追従プルーニング」を活用してアクティブなパラメータ数を大幅に削減しました。このモデルは、トークンごとではなくプロンプトごとにルーティング判断を行うことで、MLPレイヤーの約20%をアクティブ化するように設計されています。
Appleは現在、iPhoneでのデプロイ向けに人工知能モデルを圧縮する技術について、スタートアップ企業のPrismMLと協議を行っている。
MLXライブラリはバージョン0.32.0をリリースし、Metalバックエンドの特定のバグに対処しました。
研究者らは、Apple Silicon上の大規模言語モデル向けに、これまで報告された中で最高の推論スループットを達成するネイティブMetal推論ランタイム「BaseRT」を発表しました。チップ固有のカーネル融合と統一メモリ対応の最適化を活用することで、llama.cppやMLXといった既存のフレームワークで見られるオーバーヘッドを克服しています。
制約対応GPUアロケータは、7つのシナリオにおいてFIFOスケジューラと比較ベンチマークされ、同一ハードウェア上でGPU利用率が最大33パーセントポイント上昇し、優先度加重出力が最大105%増加した。このシステムは、リアルタイム推論需要を静的な予約ではなく変動する曲線として扱い、連続するGPUブロックや非プリエンプションといった厳格な制約を尊重しつつ、谷間の時間帯にバッチ処理のようなジョブで容量を埋めることを可能にする。
アクセス解析とサイト改善のために Cookie を使用します。分析 Cookie を許可または拒否できます。 プライバシーポリシー