La versión b10361 de llama.cpp aborda un error crítico donde la Atención de Ventana Deslizante (SWA) no estaba habilitada para el modelo LGAI-EXAONE 4.5 debido a un orden incorrecto de parámetros durante la carga.

  • El cargador del modelo ahora maneja correctamente los archivos GGUF de EXAONE 4.5 corrigiendo el orden en que se leen `hparams.n_layer()` y `LLM_KV_NEXTN_PREDICT_LAYERS`, asegurando que SWA se active adecuadamente.
  • La ruta solo de metadatos para la construcción de modelos ahora omite los tensores marcados con `TENSOR_SKIP`, previniendo fallos de aserción causados por tipos de búfer nulos en arquitecturas que utilizan capas nextn/MTP.
  • Se añadieron pruebas para cubrir el orden de hparams de EXAONE 4, verificando que la corrección establece correctamente `swa_type` como STANDARD en lugar de NONE.

Esta actualización asegura que las versiones oficiales GGUF de LGAI-EXAONE funcionen correctamente con atención de ventana deslizante y permite que los modelos con capas nextn/MTP se construyan a través de la ruta solo de metadatos.