llama.cpp 프로젝트는 버전 b10355를 출시하여 다중 출력 백엔드 샘플링 지원을 도입했습니다. 이 업데이트는 백엔드 샘플링과 토큰 추측을 결합하여 활성화하고, 시퀀스당 최대 출력 수를 선언하기 위한 숫자 컨텍스트 매개변수를 추가합니다.

  • 토큰 추측과 함께 백엔드 샘플링 활성화
  • 샘플링된 인덱스로 변환하기 전에 마스크 합계를 클램프
  • 단일 시퀀스에 대한 최대 출력 수를 선언하는 숫자 컨텍스트 매개변수 추가
  • CPU와 백엔드 샘플링 간의 불일치 수정 및 CPU와 GPU 간의 분포(dist) 일치
  • 변경 사항 단순화 및 Vulkan에서 테스트 수정

릴리스는 CPU, CUDA, ROCm, OpenVINO, SYCL, HIP 및 Vulkan을 포함한 다양한 하드웨어 백엔드에 대해 macOS, iOS, Linux, Android, Windows 및 openEuler용 바이너리를 제공합니다.