Hugging Face上的一项提案讨论了AI中的两个相互关联的问题:对训练独立大型模型的依赖,以及生态系统对通用GPU的依赖。

  • 作者建议“渐进式模型增长”,即模型在结构上扩展(例如从4B到8B),同时保留已学习的表示,而不是为每个尺寸从头开始。
  • 这种方法补充了固定大小的知识迁移,使模型在需要结构扩展之前能够吸收更多能力。
  • 为解决硬件限制,作者提出了针对Transformer的“AI硬件配置文件”,为专用ASIC供应商定义了一组稳定的常见操作(如GEMM和注意力)。
  • 该提案认为,模型发布应 alongside 参数量一起评估效率指标,如每焦耳token数和内存需求。

作者认为这些变化可以帮助本地AI用户克服VRAM限制,并为硬件制造商提供明确的优化目标。