Проект llama.cpp выпустил версию b10951, включающую оптимизацию кода в логике декодирования. Вызов функции `llama_n_rs_seq` теперь выполняется перед `llama_decode`, что позволяет системе возвращаться напрямую, если проверка проходит успешно.

  • Это изменение устраняет необходимость установки переменной `res` и использования оператора goto при выполнении условия раннего возврата.
  • Основная цель — избежать вызова `llama_decode`, когда это не требуется, повышая эффективность.
  • Бинарные файлы доступны для macOS (Apple Silicon и Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm) и openEuler.