O projeto ggml-org lançou a versão b10774 do llama.cpp, que inclui uma correção para o problema de falta de cache KV no módulo de fine-tuning.

  • O componente de treinamento agora lida corretamente com o uso do cache KV durante as operações de fine-tuning.
  • Binários estão disponíveis para macOS (Apple Silicon e Intel), Linux (Ubuntu com CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, OpenVINO, SYCL, ROCm) e openEuler.
  • Um XCFramework para iOS e um pacote de UI independente também estão incluídos nos ativos do lançamento.

Esta atualização garante que os fluxos de trabalho de fine-tuning funcionem corretamente, abordando o tratamento anteriormente quebrado do cache de chave-valor.