AI Model Radarは、46件の追跡対象となっているオープンウェイトモデルが特定のハードウェアに収まるかどうかを計算するための手法を発表し、4倍や40倍もの誤差を生じさせる可能性のある一般的な迷信的なルールを却下した。同サイトは、GGUFウェイトサイズの測定値の合計、設定ファイルからのコンテキストキャッシュの演算、ランタイムオーバーヘッドを合算して適合性を判断し、スライディングウィンドウやマルチヘッド潜在アテンションなどのハイブリッドアテンションメカニズムも考慮している。
- シャード分割のエラーを避けるため、ウェイトはパラメータ数ではなく公開されたバイトサイズから取得される。
- コンテキストキャッシュは、config.jsonに明示されているレイヤータイプ(フルかスライディングウィンドウか)とヘッド次元を用いて計算される。
- 標準GPUには12%の安全マージンが確保され、Apple SiliconではmacOSの制約により統一メモリ量の70%が使用される。
- RTX 3060 12 GBの場合、8Kコンテキストで14モデル、32Kコンテキストで10モデルが適合すると分析されており、Qwen3 14Bは8Kでもオフロードが必要である。
著者は速度や品質スコアの公開を拒否し、ユーザーが推測せずにハードウェアの互換性を判断できるよう、再現可能なメモリ適合性のデータにのみ焦点を当てている。