El proyecto llama.cpp lanzó la compilación b10737, que aborda errores críticos en el soporte de la arquitectura qwen4exp. La actualización resuelve problemas con la persistencia del estado de secuencia y evita abortos de CUDA durante la carga del modelo.

  • Corrige el colapso de NaN en kvu y restaura los datos de caché del indexador ext.x/ext.y durante los ciclos de guardado/restauración para modelos qwen4exp.
  • Corrija la derivación del recuento de filas per_layer_token_embd y rechaza las desreferencias de puntero nulo en las capas de caché recurrente PLE.
  • Desactiva la bandera -sm tensor para qwen4exp, que anteriormente causaba logits NaN y fallos en dispositivos reales.
  • Renombra seq_set a seq_get_all para resolver conflictos de sobrecarga de funciones y añade pruebas que verifican la integridad del estado.

Estos cambios aseguran que los modelos qwen4exp puedan cargarse y guardarse sin corrupción de datos ni errores en tiempo de ejecución, especialmente al usar contenido mrope 2D o capas PLE.