llama.cpp b10751 объединяет взвешенное снижение экспертов MoE для CUDA
Проект llama.cpp выпустил сборку b10751, которая вводит объединённое ядро для взвешенного снижения экспертов MoE (Mixture of Experts) на CUDA. Эта оптимизация заменяет предыдущую базовую реализацию, выполнявшую два физических ядра, одним ядром взвешенного снижения, чтобы уменьшить промежуточный трафик в глобальной памяти.