Proyek llama.cpp merilis versi b10907, yang mencakup perbaikan untuk alokasi cache kunci-nilai konteks Multi-Token Prediction (MTP). Pembaruan ini mengatasi masalah yang memengaruhi arsitektur deepseek2, glm4moe, dan cohere2moe.

  • Memperbaiki alokasi cache kv konteks MTP untuk model deepseek2, glm4moe, dan cohere2moe.
  • Menambahkan gerbang arsitektur invers dan pengujian arsitektur komprehensif untuk filter lapisan MTP.
  • Merampingkan komentar filter NextN dan menghapus perubahan test-llama-archs.

Rilis ini menyediakan biner untuk macOS (Apple Silicon dan Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA, OpenCL, Vulkan, OpenVINO, SYCL, ROCm), dan openEuler.