Релиз llama.cpp b10994 включает исправление для бэкенда Metal, устраняющее выходные значения NaN в операции `mul_mm_id` при превышении значениями активации диапазона f16. Этот дефект ранее приводил к тому, что модели, такие как Mistral Small 4, генерировали полностью NaN словари на этапах префиллинга длиной 32 токена и более на устройствах Apple Silicon.

  • Исправление перемасштабирует src1 на степень двойки, чтобы уместиться в пределы f16, и отменяет масштабирование в аккумуляторе f32, обеспечивая точные результаты без потери точности.
  • Бенчмарки на M2 Max показывают медианный оверхед +1.14% для затронутых путей, при этом большие размеры батчей несут немного более высокие затраты.
  • Релиз предоставляет бинарные файлы для macOS (Apple Silicon и Intel), iOS, Linux (CPU, CUDA, ROCm, OpenVINO, SYCL), Android и Windows для различных конфигураций оборудования.