llama.cpp b10814 릴리스는 아홉 가지 새로운 요소별 단항 연산을 추가하고 데이터 이동 커널을 개선하여 OpenCL 백엔드 지원을 확대합니다.
- CPU 폴백을 방지하기 위해 sgn, step, elu, hardswish, hardsigmoid, floor, ceil, round 및 trunc을 포함한 확장된 요소별 단항 연산을 추가했습니다.
- 선형 이동을 위해 전체 장치에 분배되는 연속적인 f32 복사 커널을 구현하여 긴 행이 적은 텐서에 대한 성능을 최적화했습니다.
- 커널을 특정 유형이 아닌 요소 크기에 따라 키로 사용하여 CONCAT 지원을 모든 쉽게 복사 가능한 유형(f16, bf16, i8, i16, i32, i64)으로 확장했습니다.
이러한 변경은 macOS, Linux, Windows 및 Android에서 비CPU 백엔드에 대한 OpenCL 범위와 효율성을 개선합니다.