Hugging Face论坛上的一项提案概述了一个通用的GPU执行与显存管理层,旨在将应用代码与NVIDIA、AMD和Intel等特定硬件供应商解耦。其目标是让用户能够指定显存预算,而非手动配置后端特定的标志位、设备映射或卸载策略。

  • 运行时将根据可用VRAM自动确定层放置、精度选择(INT4、INT8、FP8)以及KV缓存管理。
  • 引入了分层内存模型,包含GPU本地VRAM、扩展内存、系统RAM和NVMe存储等层级。
  • 提议将低位宽数据类型作为一等运行时特性,以防止反量化缓冲区抵消量化带来的收益。
  • 该架构旨在通过控制整个运行时的显存占用,使13B规模INT4推理在12 GB消费级GPU上变得可行。

该方法旨在解决软件兼容性碎片化和VRAM限制问题,使AI工作负载能够在多供应商GPU市场中高效运行,而无需与CUDA或其他供应商特定的后端紧密耦合。