llama.cpp 프로젝트는 빌드 b10584를 출시하여 초안 컨텍스트 크기가 대상 컨텍스트와 일치하지 않아 서버 요청이 500 오류로 실패하는 중대한 문제를 해결했습니다.
- 서버는 이제 초안 컨텍스트가 대상 컨텍스트의 크기를 따르도록 보장하여 슬롯이 이전 제한을 초과하여 채워질 때 디코딩 실패를 방지합니다.
- 초안 모델에 대한 메모리 예약은 대상이 수용할 수 있는 가장 큰 컨텍스트로 측정되며, 대상과 셀을 공유하는 컨텍스트는 kv_size 재정의에서 제외될 수 있습니다.
- fit 함수는 이제 선택적 두 번째 모델을 고려하여 메인 컨텍스트가 변경될 때마다 해당 메모리가 측정되도록 하여 reduce 경로를 정확하게 유지합니다.
이 업데이트는 초안과 대상 컨텍스트 크기를 동적으로 정렬하여 서버 배포의 안정성 문제를 해결합니다.