Проект llama.cpp выпустил сборку b10673, включающую специфические оптимизации производительности для аппаратного обеспечения Apple M4. Это обновление вводит записи fa_vec_tuned_table в модуль ggml-metal-tuning для повышения эффективности бэкенда Metal.

  • Добавлены настроенные таблицы поиска для квантований F16, Q4_0, Q4_1, Q5_0, Q5_1 и Q8_0 на чипах M4 с 10 ядрами GPU.
  • Предоставлены бинарные файлы для macOS Apple Silicon (arm64), macOS Intel (x64) и iOS XCFramework.
  • Включены сборки Linux для Ubuntu x64 и arm64 для бэкендов CPU, Vulkan, ROCm 7.14, OpenVINO и SYCL.
  • Предложены бинарные файлы Windows для CPU, OpenCL Adreno, CUDA 12/13, Vulkan, OpenVINO, SYCL и ROCm 7.14.
  • Добавлена поддержка Android arm64 (CPU) и бинарные файлы пользовательского интерфейса.

Это обновление гарантирует, что пользователи устройств Apple M4 смогут использовать оптимизированные ядра Metal для более быстрого вывода.