El proyecto llama.cpp ha lanzado la versión 0.1.2, que incluye una sincronización con ggml (actualizado a 0.20.2) y varias actualizaciones en los componentes del servidor y la interfaz de usuario.
- CUDA: MMVQ nwarps=8 para bs=1 para modelos densos en DGX Spark.
- mtmd: usar sha256 para el hash de entrada.
- vocab: soporte para puntuaciones enteras del tokenizador.
- mtmd: omitir miniaturas para imágenes LFM2 no agrupadas.
- server: guardar fragmentos procesados de mtmd como marcador de posición.
- ui: imponer orden alfabético de miembros de enumeración y refactorizar el nombre de Herramientas Integradas.
Esta versión también aborda limpiezas de compilación para xcframework + cmake y actualiza los procesos de CI para la generación de versiones preliminares.