El proyecto llama.cpp ha lanzado la versión 0.1.2, que incluye una sincronización con ggml (actualizado a 0.20.2) y varias actualizaciones en los componentes del servidor y la interfaz de usuario.

  • CUDA: MMVQ nwarps=8 para bs=1 para modelos densos en DGX Spark.
  • mtmd: usar sha256 para el hash de entrada.
  • vocab: soporte para puntuaciones enteras del tokenizador.
  • mtmd: omitir miniaturas para imágenes LFM2 no agrupadas.
  • server: guardar fragmentos procesados de mtmd como marcador de posición.
  • ui: imponer orden alfabético de miembros de enumeración y refactorizar el nombre de Herramientas Integradas.

Esta versión también aborda limpiezas de compilación para xcframework + cmake y actualiza los procesos de CI para la generación de versiones preliminares.