Hugging Face 发布了 @huggingface/kernels,这是一个用于从 Hugging Face Hub 加载和运行优化后的 WebGPU 内核的库,并附带了首批 207 个内核。此次发布还引入了 Fleet,一个在浏览器中运行的 GPU 基准测试套件,它通过众包方式收集来自用户设备的性能和正确性证据。

  • 内核集合包括矩阵乘法、注意力原语等操作,每个操作都作为带清单、正确性测试和 WGSL 着色器模板的版本化仓库发布。
  • @huggingface/kernels 提供了一个 JavaScript 加载器,通过显式合约版本从 Hub 直接下载并执行内核。
  • 在 Apple M4 GPU 上的基准测试显示,新内核的几何平均速度比 ORT WebGPU 快 2.57 倍,其中双线性 Einsum 等特定场景的速度提升超过 10,000 倍。
  • Fleet 允许用户在自有硬件上运行测试,贡献私有证据以帮助识别故障并改进不同真实设备上的内核变体。

该基础旨在通过提供透明、版本化的操作合约以及广泛的真实世界性能数据,使 WebAI 生态系统中更快的本地推理更易于使用。