llama.cpp 프로젝트는 버전 b10199을 출시하여 서버 구성 요소에 새로운 기능을 도입했습니다. 주요 업데이트는 서버가 다음 토큰을 생성하기 위한 임베딩을 지원하도록 하며, 특히 샘플링된 토큰의 임베딩에 대한 지원을 추가합니다.

  • 서버는 이제 다음 토큰 예측 워크플로우를 촉진하기 위해 샘플링된 토큰에 대한 임베딩 생성을 지원합니다.
  • ~server_batch() 소멸자에 수정이 적용되었습니다.
  • 이 릴리스에서는 KleidiAI가 포함된 macOS Apple Silicon (arm64) 빌드가 비활성화되었습니다.
  • CPU, CUDA, Vulkan, ROCm, OpenVINO, SYCL 및 OpenCL 백엔드를 위한 Linux, Windows, Android 및 macOS용 사전 빌드된 바이너리를 사용할 수 있습니다.

이 업데이트를 통해 llama.cpp 서버를 활용하는 사용자는 생성 중에 토큰 임베딩에 직접 액세스할 수 있으며, 이는 출력 토큰의 벡터 표현이 필요한 애플리케이션에 유용합니다.