Hugging Face a publié @huggingface/kernels, une bibliothèque pour charger et exécuter des noyaux WebGPU optimisés depuis le Hub Hugging Face, accompagnée d'une collection initiale de 207 noyaux. La publication introduit également Fleet, une suite de benchmarking GPU dans le navigateur qui mutualise les preuves de performance et de correction issues des appareils des utilisateurs.
- La collection de noyaux inclut des opérations telles que les multiplications matricielles et les primitives d'attention, chacune publiée en tant que dépôt versionné avec des manifestes, des tests de correction et des modèles de shaders WGSL.
- @huggingface/kernels fournit un chargeur JavaScript qui télécharge et exécute les noyaux directement depuis le Hub en utilisant des versions de contrat explicites.
- Les benchmarks sur un GPU Apple M4 ont montré que les nouveaux noyaux étaient 2,57 fois plus rapides en moyenne géométrique par rapport à ORT WebGPU, avec des cas spécifiques comme l'Einsum bilinéaire s'exécutant plus de 10 000 fois plus vite.
- Fleet permet aux utilisateurs d'exécuter des tests sur leur matériel, contribuant avec des preuves privées pour aider à identifier les échecs et améliorer les variantes de noyaux sur divers appareils du monde réel.
Cette fondation vise à faciliter l'inférence locale rapide dans l'écosystème WebAI en fournissant des contrats d'opération transparents et versionnés, ainsi que des données de performance larges et issues du monde réel.