llama.cpp 프로젝트는 CUDA 및 Metal 백엔드에서 ggml_roll 연산에 대한 중요한 버그를 해결하는 빌드 b10353을 출시했습니다. 이전에는 이러한 백엔드가 스트라이드 정보를 무시했기 때문에 치환된(연속되지 않은) 소스 텐서가 침묵한 잘못된 결과를 생성했습니다.
- 수정은 CUDA 및 Metal roll 커널 모두에 연속된 소스 요구사항을 추가하여 기존 GGML_OP_ROPE 가드와 일치합니다.
- 이 변경으로 스케줄러가 스트라이드를 올바르게 처리하는 CPU 구현으로 비연속 입력에 대해 폴백되도록 보장됩니다.
- 수정을 검증하기 위해 치환된 test_roll 사례가 추가되었습니다.
이 업데이트는 표준 이외의 메모리 레이아웃과 함께 ROLL 연산에 의존하는 모델에서의 데이터 손상을 방지합니다.