本記事では、Symphonyを提案しています。これは、GPUなどの現在の高性能アーキテクチャにおけるメモリシステムの非効率に対処するために設計された、ハイブリッドなプログラム可能かつ専用アーキテクチャです。不要なデータ移動と距離を削減するため、メモリ階層全体でデータをオーケストレーションすることに焦点を当てています。

  • Symphonyは、ルーフライン浮動小数点計算用の専用再構成ユニットと、アドレス生成、データフィルタリング、疎メタデータ処理などのデータオーケストレーション機能を利用します。
  • プログラム可能および専用タスクをサポートするため、演算リソースはオンチップメモリ階層全体に分散されています。
  • このアーキテクチャは、ドメイン固有アクセラレータが通常処理できない疎および密アルゴリズムの混合を扱うことを目指しています。

Symphonyは、疎テンソル代数においてプログラム不可能なASICのパフォーマンスに匹敵し、同等のプロビジョニングされたGPUと比較して、実行時間が31倍改善され、エネルギー効率が44倍改善されています。