Пользователь Reddit под именем Intrepid_Rub_3566 опубликовал видеообзор, оценивающий производительность GLM 5.2 в конфигурации с двумя процессорами AMD Strix Halo и 256 ГБ оперативной памяти. Обсуждение сосредоточено на том, обеспечивает ли данная конкретная аппаратная конфигурация достаточную ценность для локального вывода больших языковых моделей. Материал подчеркивает техническую возможность развертывания GLM 5.2 в такой среде, уделяя внимание использованию ресурсов и скорости. Зрителям предлагается перейти по ссылке на YouTube для получения подробных бенчмарков и метрик производительности. В теме также присутствуют комментарии сообщества, обсуждающие практическую применимость и рентабельность такого подхода с использованием двух GPU.
GLM 5.2 на конфигурации с двумя Strix Halo (256 ГБ): стоит ли того?
Производительность GLM5.2
Пользователь Reddit собирает данные о скорости инференса для 460GB nvfp4 чекпоинта GLM5.2 от Nvidia из сообщества.
GLM5.2 на 5x Pro 6000s и 5090: дорогой путь
Пользователь описывает свой масштабный процесс обновления оборудования для локального запуска модели GLM 5.2, который завершился конфигурацией из пяти GPU AMD Radeon Pro W6800 и одного NVIDIA RTX 5090.
llama.cpp b11160 добавляет int8 coopmat1 matmul для AMD RDNA3/4 и поддержку IQ4_XS
Проект llama.cpp выпустил версию b11160, внедряя реализацию int8 cooperative matrix (coopmat1) для Vulkan на архитектурах AMD RDNA3 и RDNA4. Это обновление включает выделенный шейдер, который напрямую опрашивает значения coopmat для повышения производительности.
llama.cpp b11059 добавляет поддержку F16 в ядро FWHT для Metal
Проект llama.cpp выпустил сборку b11059, которая вносит значительные обновления в бэкенд Metal для оборудования Apple Silicon. Основное изменение — добавление поддержки входных данных F16 в ядро быстрого преобразования Уолша-Адамара (FWHT), что позволяет ему напрямую считывать источники F16 без необходимости создания конвертированной копии.
llama.cpp повышает лимит экспертов для mul_mat_id в Vulkan до 1024
Проект llama.cpp увеличил вынесенный предел row-id для операции Vulkan mul_mat_id с 256 до 1024 экспертов. Это изменение устраняет узкие места производительности в моделях с большим количеством экспертов, таких как Qwen3.8-Flash-Next, которые ранее работали по более медленному пути кода из-за ограничений размера разделяемого массива.