Hugging Face는 Hugging Face Hub에서 최적화된 WebGPU 커널을 로드하고 실행하기 위한 라이브러리인 @huggingface/kernels와 함께 초기 207개 커널 컬렉션을 출시했습니다. 이번 출시에는 사용자의 기기에서 성능과 정확성에 대한 증거를 크라우드소싱하는 브라우저 내 GPU 벤치마킹 스위트인 Fleet도 포함되어 있습니다.
- 커널 컬렉션에는 행렬 곱셈 및 어텐션 기본 연산과 같은 작업이 포함되며, 각 작업은 매니페스트, 정확성 테스트, WGSL 셰이더 템플릿이 포함된 버전 관리된 저장소로 게시됩니다.
- @huggingface/kernels는 명시적 계약 버전을 사용하여 Hub에서 커널을 직접 다운로드하고 실행하는 JavaScript 로더를 제공합니다.
- Apple M4 GPU에서의 벤치마크 결과, 새로운 커널은 기하 평균 기준 ORT WebGPU보다 2.57배 더 빠르며, 이차원 Einsum과 같은 특정 사례에서는 10,000배 이상 빠르게 실행되었습니다.
- Fleet을 사용하면 사용자가 자신의 하드웨어에서 테스트를 실행하여 사적인 증거를 기여함으로써 실패를 식별하고 다양한 실제 환경의 기기 전반에 걸쳐 커널 변형을 개선하는 데 도움을 줄 수 있습니다.
이 기반은 투명하고 버전 관리된 작업 계약과 광범위한 실제 성능 데이터를 제공함으로써 WebAI 생태계 전반에서 빠른 로컬 추론을 더 쉽게 사용할 수 있도록 하는 것을 목표로 합니다.