A Hugging Face lançou @huggingface/kernels, uma biblioteca para carregar e executar kernels WebGPU otimizados do Hugging Face Hub, junto com uma coleção inicial de 207 kernels. O lançamento também apresenta o Fleet, um conjunto de testes de GPU no navegador que coleta evidências de desempenho e correção dos dispositivos dos usuários.
- A coleção de kernels inclui operações como multiplicações de matrizes e primitivas de atenção, cada uma publicada como um repositório versionado com manifestos, testes de correção e modelos de sombreamento WGSL.
- @huggingface/kernels fornece um carregador JavaScript que baixa e executa kernels diretamente do Hub usando versões explícitas de contrato.
- Os benchmarks em uma GPU Apple M4 mostraram que os novos kernels foram 2,57x mais rápidos em média geométrica em comparação com o ORT WebGPU, com casos específicos como bilinear Einsum rodando mais de 10.000x mais rápido.
- O Fleet permite que os usuários executem testes em seu hardware, contribuindo com evidências privadas para ajudar a identificar falhas e melhorar as variantes dos kernels em diversos dispositivos do mundo real.
Essa fundação visa tornar a inferência local rápida mais fácil de usar em todo o ecossistema WebAI, fornecendo contratos de operação transparentes e versionados, além de dados amplos de desempenho do mundo real.