El proyecto llama.cpp ha lanzado la compilación b10593, que aborda problemas críticos con la arquitectura del modelo DeepseekV4. La actualización resuelve específicamente un fallo de retroceso que ocurrió durante el procesamiento de múltiples secuencias.

  • Corrige el manejo del retroceso de DeepseekV4 para contextos de múltiples secuencias.
  • Corrige los procedimientos generales de carga del modelo.
  • Hace que las operaciones de retroceso pendientes sean de un solo uso para prevenir la corrupción del estado.
  • Asegura que la caché se borre solo para el ID de secuencia específico durante las cargas completas.
  • Añade aserciones para las ratios de compresión y hace estática la topología del grafo.

Esta versión mejora la estabilidad para los usuarios que ejecutan modelos DeepseekV4 con múltiples secuencias. También proporciona binarios actualizados para macOS, Linux, Windows, Android e iOS en varios backends de hardware incluyendo CPU, CUDA, ROCm y Vulkan.