AI Model Radar 发布了一种计算方法,用于判断 46 个受追踪的开源权重模型是否能适配特定硬件,摒弃了那些可能产生四倍或四十倍误差的常见经验法则。该网站通过累加实测 GGUF 权重大小、来自配置文件的上下文缓存算术值以及运行时开销来确定适配情况,同时考虑了滑动窗口和多头潜在注意力等混合注意力机制。

  • 权重数据取自公布的字节大小而非参数量,以避免分片错误。
  • 上下文缓存的计算使用 config.json 中明确指出的层类型(完整与滑动窗口)和头维度。
  • 标准 GPU 保留 12% 的安全余量,而 Apple Silicon 由于 macOS 限制仅使用统一内存的 70%。
  • 对于 RTX 3060 12 GB,分析显示在 8K 上下文时可适配 14 个模型,在 32K 上下文时可适配 10 个;Qwen3 14B 即使在 8K 下也需要卸载。

作者拒绝发布速度或质量评分,仅专注于可复现的内存适配数据,以帮助用户确定硬件兼容性,无需猜测。