Hugging Face telah merilis @huggingface/kernels, sebuah pustaka untuk memuat dan menjalankan kernel WebGPU yang dioptimalkan dari Hugging Face Hub, bersama dengan koleksi awal berisi 207 kernel. Rilis ini juga memperkenalkan Fleet, sebuah suite benchmark GPU di browser yang mengumpulkan bukti kinerja dan kebenaran dari perangkat pengguna.

  • Koleksi kernel mencakup operasi seperti perkalian matriks dan primitif perhatian, masing-masing dipublikasikan sebagai repositori versi dengan manifest, uji kebenaran, dan templat shader WGSL.
  • @huggingface/kernels menyediakan pemuat JavaScript yang mengunduh dan mengeksekusi kernel langsung dari Hub menggunakan versi kontrak eksplisit.
  • Benchmark pada GPU Apple M4 menunjukkan bahwa kernel baru 2,57x lebih cepat secara rata-rata geometris dibandingkan ORT WebGPU, dengan kasus khusus seperti bilinear Einsum berjalan lebih dari 10.000x lebih cepat.
  • Fleet memungkinkan pengguna menjalankan uji pada perangkat keras mereka, memberikan bukti privat untuk membantu mengidentifikasi kegagalan dan meningkatkan varian kernel di berbagai perangkat dunia nyata.

Fondasi ini bertujuan memudahkan inferensi lokal yang cepat dalam ekosistem WebAI dengan menyediakan kontrak operasi yang transparan dan terverifikasi serta data kinerja luas dari dunia nyata.