本文提出了 Symphony,这是一种混合可编程和专用架构,旨在解决当前高性能架构(如 GPU)中内存系统效率低下的问题。它专注于在整个内存层次结构中编排数据,以减少不必要的数据移动和距离。

  • Symphony 利用专用的可重构单元进行符合屋顶线(roofline)的浮点计算,并具备地址生成、数据过滤和稀疏元数据处理等数据编排功能。
  • 计算资源分布在整个片上内存层次结构中,以支持可编程和专用任务。
  • 该架构旨在处理域特定加速器通常无法管理的稀疏和稠密算法混合体。

在稀疏张量代数方面,Symphony 达到了不可编程 ASIC 的性能水平,与同等配置的 GPU 相比,运行时提高了 31 倍,能效提高了 44 倍。