Hugging Face ha lanzado @huggingface/kernels, una biblioteca para cargar y ejecutar núcleos WebGPU optimizados desde el Hub de Hugging Face, junto con una colección inicial de 207 núcleos. El lanzamiento también introduce Fleet, un conjunto de evaluación de GPU en el navegador que recopila evidencia de rendimiento y corrección de los dispositivos de los usuarios.

  • La colección de núcleos incluye operaciones como multiplicaciones de matrices y primitivas de atención, cada una publicada como un repositorio versionado con manifiestos, pruebas de corrección y plantillas de sombreadores WGSL.
  • @huggingface/kernels proporciona un cargador JavaScript que descarga y ejecuta núcleos directamente desde el Hub utilizando versiones explícitas del contrato.
  • Las evaluaciones en una GPU Apple M4 mostraron que los nuevos núcleos fueron 2.57 veces más rápidos por media geométrica en comparación con ORT WebGPU, con casos específicos como bilinear Einsum ejecutándose más de 10,000 veces más rápido.
  • Fleet permite a los usuarios ejecutar pruebas en su hardware, contribuyendo con evidencia privada para ayudar a identificar fallos y mejorar las variantes de núcleos en diversos dispositivos del mundo real.

Esta fundación tiene como objetivo facilitar el uso de inferencia local rápida en todo el ecosistema WebAI proporcionando contratos de operación transparentes y versionados, así como datos de rendimiento amplios y del mundo real.