El artículo propone Symphony, una arquitectura híbrida programable y especializada diseñada para abordar las ineficiencias del sistema de memoria en arquitecturas actuales de alto rendimiento como las GPU. Se centra en orquestar los datos a lo largo de la jerarquía de memoria para reducir el movimiento innecesario de datos y la distancia.
- Symphony utiliza unidades reconfigurables especializadas para cálculos de punto flotante según el techo (roofline) junto con funciones de orquestación de datos como generación de direcciones, filtrado de datos y procesamiento de metadatos dispersos.
- Los recursos de cómputo se distribuyen a lo largo de la jerarquía de memoria en chip para soportar tanto tareas programables como especializadas.
- La arquitectura tiene como objetivo manejar una mezcla de algoritmos dispersos y densos que los aceleradores específicos del dominio típicamente no pueden gestionar.
Symphony iguala el rendimiento de ASICs no programables en álgebra de tensores dispersos, proporcionando una mejora de 31x en el tiempo de ejecución y 44x en la eficiencia energética en comparación con una GPU provista de manera comparable.