llama.cpp versión 0.4.0 introduce soporte de arquitectura inicial para los modelos Qwen3.8-Flash-Next y NVIDIA Nemotron-3-Puzzle-75B-A9B, junto con una actualización de la biblioteca subyacente ggml a la versión 0.23.0.

  • Se añadió lectura de tensores perezosa bajo demanda y límites de contexto del servidor por ranura.
  • Actualización de ggml a 0.23.0 con atención flash dispersa y soporte de transporte Apple RDMA.
  • Se introdujeron opciones de entrada de vídeo, búsqueda de historial n-gramas y límites de RAM para el cuantizador.
  • Se habilitó `preserve_reasoning` por defecto en el servidor y se mejoraron los ayudantes de tokenización multimodal.

Estos cambios amplían la compatibilidad del modelo y proporcionan a los desarrolladores un control más fino sobre el uso de la memoria y la asignación de recursos del servidor.