O projeto llama.cpp lançou a compilação b10868, que introduz o tratamento de tipos IQ para modelos Mixture of Experts (MoE).

  • Adiciona suporte para tipos de quantização IQ dentro das arquiteturas MoE por meio do pull request #28476.
  • Fornece binários para macOS (Apple Silicon e Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Windows (CPU, CUDA 12/13, Vulkan, OpenCL, ROCm, SYCL), Android e openEuler.
  • Inclui suporte ao iOS XCFramework e um pacote de interface do usuário independente.

Esta atualização permite que os usuários executem modelos MoE com tipos de quantização IQ específicos em uma ampla gama de plataformas de hardware.