Проект llama.cpp выпустил сборку b10835, которая содержит исправление проблемы с расходящимся барьером в реализации ggml-cuda для f16 flash attention. Это обновление также устраняет дублирование настройки указателя метаданных в том же модуле.

  • Исправляет расходящийся барьер в ggml-cuda f16 flash attention (PR #27870).
  • Предотвращает дублирование настройки указателя метаданных в ggml-cuda.

Этот релиз предоставляет обновленные бинарные файлы для macOS, Linux, Windows, Android и openEuler для различных CPU и GPU бэкендов, включая CUDA, Vulkan, ROCm и SYCL.