O artigo propõe o Symphony, uma arquitetura híbrida programável e especializada projetada para abordar ineficiências no sistema de memória em arquiteturas atuais de alto desempenho, como GPUs. Ele foca na orquestração de dados ao longo da hierarquia de memória para reduzir o movimento desnecessário de dados e a distância.

  • O Symphony utiliza unidades reconfiguráveis especializadas para cálculos de ponto flutuante conforme o limite superior (roofline), junto com recursos de orquestração de dados, como geração de endereços, filtragem de dados e processamento de metadados esparsos.
  • Os recursos de computação são distribuídos por toda a hierarquia de memória no chip para suportar tarefas programáveis e especializadas.
  • A arquitetura visa lidar com uma mistura de algoritmos esparsos e densos que aceleradores específicos de domínio tipicamente não conseguem gerenciar.

O Symphony iguala o desempenho de ASICs não programáveis em álgebra de tensores esparsos, proporcionando 31x mais velocidade de execução e 44x mais eficiência energética em comparação com uma GPU provisionada de forma semelhante.