Proyek llama.cpp telah merilis build b10868, yang memperkenalkan penanganan tipe IQ untuk model Mixture of Experts (MoE).

  • Menambahkan dukungan untuk tipe kuantisasi IQ dalam arsitektur MoE melalui pull request #28476.
  • Menyediakan biner untuk macOS (Apple Silicon dan Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Windows (CPU, CUDA 12/13, Vulkan, OpenCL, ROCm, SYCL), Android, dan openEuler.
  • Termasuk dukungan iOS XCFramework dan paket UI mandiri.

Pembaruan ini memungkinkan pengguna menjalankan model MoE dengan tipe kuantisasi IQ tertentu di berbagai platform perangkat keras.