Компания Hugging Face выпустила библиотеку @huggingface/kernels для загрузки и запуска оптимизированных ядер WebGPU из Hugging Face Hub, а также начальную коллекцию из 207 ядер. В релиз также вошёл Fleet — набор для браузерного бенчмаркинга GPU, который собирает данные о производительности и корректности с устройств пользователей.

  • Коллекция ядер включает операции, такие как умножение матриц и примитивы внимания; каждая опубликована в виде версионированного репозитория с манифестами, тестами на корректность и шаблонами шейдеров WGSL.
  • @huggingface/kernels предоставляет загрузчик на JavaScript, который загружает и выполняет ядра напрямую из Hub, используя явные версии контрактов.
  • Бенчмарки на GPU Apple M4 показали, что новые ядра в среднем (по геометрическому среднему) работают в 2.57 раза быстрее по сравнению с ORT WebGPU, а в отдельных случаях, таких как билинейный Einsum, ускорение превысило 10 000 раз.
  • Fleet позволяет пользователям запускать тесты на своём оборудовании, предоставляя приватные данные для выявления ошибок и улучшения вариантов ядер на разнообразных реальных устройствах.

Эта основа призвана сделать быстрый локальный вывод более доступным в экосистеме WebAI, обеспечивая прозрачные версионированные контракты операций и широкие данные о производительности в реальных условиях.