Пользователь Reddit под именем Intrepid_Rub_3566 опубликовал видеообзор, оценивающий производительность GLM 5.2 в конфигурации с двумя процессорами AMD Strix Halo и 256 ГБ оперативной памяти. Обсуждение сосредоточено на том, обеспечивает ли данная конкретная аппаратная конфигурация достаточную ценность для локального вывода больших языковых моделей. Материал подчеркивает техническую возможность развертывания GLM 5.2 в такой среде, уделяя внимание использованию ресурсов и скорости. Зрителям предлагается перейти по ссылке на YouTube для получения подробных бенчмарков и метрик производительности. В теме также присутствуют комментарии сообщества, обсуждающие практическую применимость и рентабельность такого подхода с использованием двух GPU.
GLM 5.2 на конфигурации с двумя Strix Halo (256 ГБ): стоит ли того?
Производительность GLM5.2
Пользователь Reddit собирает данные о скорости инференса для 460GB nvfp4 чекпоинта GLM5.2 от Nvidia из сообщества.
GLM5.2 на 5x Pro 6000s и 5090: дорогой путь
Пользователь описывает свой масштабный процесс обновления оборудования для локального запуска модели GLM 5.2, который завершился конфигурацией из пяти GPU AMD Radeon Pro W6800 и одного NVIDIA RTX 5090.
llama.cpp b10306 добавляет плоский путь GLU для SYCL и объединяет ядра
Релиз llama.cpp b10306 вносит оптимизации производительности для бэкенда SYCL, конкретно направленные на операции Gated Linear Unit (GLU). Обновление добавляет непрерывный быстрый путь для объединённых операций GLU и объединяет ранее различные ядра для использования общего загрузчика.
llama.cpp b10255 расширяет oneDNN SDPA для не-FP16 KV-кэшей
Релиз llama.cpp b10255 расширяет путь oneDNN SDPA для поддержки не-FP16 ключ-значения (KV) кэшей, включая форматы квантования Q4_0–Q8_0 и FP32. Это обновление позволяет слитому систолическому ядру выполняться идентично нативному пути FP16 за счёт деквантования или преобразования тензоров K/V в плотный FP16 на устройстве перед обработкой.
Lucebox и AMD обогнали Nvidia DGX Spark в 3,63 раза на DeepSeek V4 Flash
Lucebox объединила усилия с AMD для демонстрации гетерогенной конфигурации потребительского оборудования, которая превосходит Nvidia DGX Spark по скорости вывода. Система сочетает GPU AMD Radeon AI PRO R9700 и процессор Strix Halo для запуска полной модели DeepSeek V4 Flash на 284B.