El proyecto llama.cpp lanzó la versión b10751, que introduce un núcleo fusionado para la reducción de expertos ponderados de MoE (Mixture of Experts) en CUDA. Esta optimización reemplaza la línea base anterior que ejecutaba dos núcleos físicos con un único núcleo de reducción ponderada para reducir el tráfico intermedio de memoria global.

  • El núcleo fusionado maneja k=2..15 expertos mediante un único kernel de runtime-k, admitiendo tanto gráficos de ponderación de expertos escalados como no escalados.
  • Coincide con secuencias de operaciones estructurales, formas, pasos y cadenas de ADD de izquierda a derecha mientras mantiene el mismo orden de reducción.

La integración del asignador asegura que los expertos, los pesos del enrutador y las escalas opcionales permanezcan activos hasta que se escriba el destino fusionado.

  • Los gráficos no reconocidos o inseguros retroceden al camino por-op existente, que se puede desactivar mediante GGML_CUDA_MOE_WEIGHTED_REDUCTION=0.

Este cambio mejora el rendimiento de los modelos MoE en CUDA minimizando el uso del ancho de banda de memoria durante la fase de combinación de expertos.