El proyecto llama.cpp ha lanzado la compilación b10868, que introduce el manejo de tipos IQ para modelos Mixture of Experts (MoE).

  • Añade soporte para tipos de cuantización IQ dentro de las arquitecturas MoE a través del pull request #28476.
  • Proporciona binarios para macOS (Apple Silicon e Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Windows (CPU, CUDA 12/13, Vulkan, OpenCL, ROCm, SYCL), Android y openEuler.
  • Incluye soporte para iOS XCFramework y un paquete de interfaz de usuario independiente.

Esta actualización permite a los usuarios ejecutar modelos MoE con tipos de cuantización IQ específicos en una amplia gama de plataformas de hardware.