llama.cpp 프로젝트는 b10724 빌드를 출시했으며, 이는 연속된 실행마다 scatter 읽기를 배치 처리하여 비연속 KV 캐시 셀의 복원 성능을 크게 개선했습니다.
- 파편화된 링 버퍼에 대한 상태 복원을 최적화하여 연속된 대상 인덱스를 사전 계산하고 개별 셀 복사 대신 단일 복사를 사용했습니다.
- 저장 및 복원된 텐서 수가 일치하지만 청킹이 다른 경우 장치 내 리더에서 어설션 실패가 발생하던 문제를 수정하고 바이트 커서 복사로 폴백했습니다.
- 인터리브된 시퀀스 셀에 대해 바이트 단위로 동일한 상태 복원을 검증하는 호스트 및 장치 내 테스트를 추가했습니다.
이 최적화로 대규모 복원에 필요한 메모리 복사 횟수가 130만 이상에서 224로 줄어들어, 복원 시간이 수십 초에서 절반 초 미만으로 단축되었습니다.