Проект llama.cpp выпустил версию 0.5.0, сосредоточившись на производительности бэкендов, более широком покрытии моделей и более стабильной работе сервера. Это обновление вводит поддержку новых архитектур, таких как HRM-Text (DFM Mimir 1B) и MiMo-V2.6, а также значительно повышает вычислительную эффективность за счёт оптимизаций CUDA и Metal.

  • Ускоряет операции CUDA conv2d с использованием неявного GEMM.
  • Добавляет оптимизации слияния Metal MoE и SSM_CONV.
  • Позволяет серверу привязываться к нескольким адресам через разделённые запятыми TCP-адреса и UNIX-сокеты.
  • Включает вывод изображений из вызовов функций путём добавления поддержки input_image.
  • Обновляет ggml до версии v0.25.0, расширяя поддержку гиперсвязей и flash-attention на всех бэкендах.

Релиз улучшает стабильность дочерних процессов, порождённых маршрутизатором, и исправляет несколько проблем с парсером чата, обеспечивая более надёжную работу для пользователей, разворачивающих llama.cpp в производственных средах.