El proyecto llama.cpp ha lanzado la compilación b10868, que introduce el manejo de tipos IQ para modelos Mixture of Experts (MoE).
- Añade soporte para tipos de cuantización IQ dentro de las arquitecturas MoE a través del pull request #28476.
- Proporciona binarios para macOS (Apple Silicon e Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Windows (CPU, CUDA 12/13, Vulkan, OpenCL, ROCm, SYCL), Android y openEuler.
- Incluye soporte para iOS XCFramework y un paquete de interfaz de usuario independiente.
Esta actualización permite a los usuarios ejecutar modelos MoE con tipos de cuantización IQ específicos en una amplia gama de plataformas de hardware.