Проект llama.cpp выпустил сборку b10605, которая включает ключевую оптимизацию для архитектуры Mamba2. Обновление выравнивает входные и выходные проекции моделей Mamba2 для диспетчеризации операций умножения общих матриц (GEMM) вместо операций умножения общей матрицы на вектор (GEMV).
- Выравнивает входные/выходные проекции mamba2 для включения диспетчеризации GMM вместо GEMV.
- Удаляет избыточные операции перестройки выхода внутри реализации Mamba2.
Этот релиз предоставляет бинарные файлы для macOS, Linux, Windows, Android и openEuler на различных аппаратных бэкендах, включая CPU, CUDA, ROCm, Vulkan и OpenVINO.