Проект llama.cpp выпустил версию b10950, внедряя критическое обновление в свой бэкенд ggml-cuda. Этот релиз обеспечивает совместимость с оборудованием, не имеющим нативного ускорения BFloat16, за счёт переключения на точность FP32.

  • Бэкенд CUDA теперь переходит на F32 на устройствах без аппаратного ускорения BF16 для Nvidia (>= AMPERE) и AMD (>= RDNA3 или = CDNA).
  • Логика, ранее применявшаяся к другим архитектурам, была расширена и на GPU NVIDIA.
  • Бинарные файлы предоставляются для macOS, Linux, Windows, Android и openEuler для бэкендов CPU, CUDA, Vulkan, ROCm, OpenVINO и SYCL.

Это изменение позволяет пользователям со старыми или специфическими архитектурами GPU запускать модели без ошибок совместимости оборудования.