Проект llama.cpp выпустил версию b10739, которая включает специфическую оптимизацию производительности для аппаратного обеспечения Apple M2 Max. Это обновление вводит быструю настройку векторов внимания (fa-vec), адаптированную под 30 GPU-ядер M2 Max.

  • Добавлены строки настройки fa-vec для M2 Max, собранные с помощью ggml-metal-tuning на форматах данных f16 и q8_0.
  • Предоставлены бинарные файлы для macOS Apple Silicon, Intel Macs, iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), Android и openEuler.

Этот релиз обеспечивает оптимизированную производительность вывода на новейшем чипе Apple silicon при сохранении широкой поддержки различных операционных систем и аппаратных ускорителей.