O projeto llama.cpp lançou a versão b10951, que inclui uma otimização de código na lógica de decodificação. A chamada à função `llama_n_rs_seq` agora é executada antes do `llama_decode`, permitindo que o sistema retorne diretamente se a verificação for bem-sucedida.

  • Esta alteração elimina a necessidade de definir a variável `res` e usar uma instrução goto quando a condição de retorno antecipado é atendida.
  • A motivação principal é evitar invocar o `llama_decode` quando não é necessário, melhorando a eficiência.
  • Os binários estão disponíveis para macOS (Apple Silicon e Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm) e openEuler.