llama.cpp b10751 为 CUDA 融合 MoE 加权专家归约
llama.cpp 项目发布了构建版本 b10751,其中引入了针对 CUDA 上 MoE(混合专家)加权专家归约的融合内核。该优化用单个加权归约内核替换了之前运行两个物理内核的基线方案,以减少中间全局内存流量。
llama.cpp 项目发布了构建版本 b10751,其中引入了针对 CUDA 上 MoE(混合专家)加权专家归约的融合内核。该优化用单个加权归约内核替换了之前运行两个物理内核的基线方案,以减少中间全局内存流量。
llama.cpp 项目发布了构建版本 b10750,重构了键值单元管理以改进序列位置索引和 n-gram 历史查找。
llama.cpp 项目发布了 b10742 版本,其中包含一项新功能,专门为 MacBook Neo 中的 Apple A18 Pro 芯片添加了快速向量 (fa-vec) 调优。
llama.cpp 项目发布了版本 b10739,其中包括针对 Apple M2 Max 硬件的特定性能优化。此更新引入了针对 M2 Max 的 30 个 GPU 核心的快速注意力向量 (fa-vec) 调优。
Hugging Face 发布了 @huggingface/kernels,这是一个用于从 Hugging Face Hub 加载和运行优化后的 WebGPU 内核的库,并附带了首批 207 个内核。此次发布还引入了 Fleet,一个在浏览器中运行的 GPU 基准测试套件,它通过众包方式收集来自用户设备的性能和正确性证据。
llama.cpp 项目发布了版本 b10734,其中包括一项更新,旨在为搭载 M5+ 或 A19+ 芯片的设备启用 Metal 4.0 tensor API。
Turboderp 发布了 ExLlamaV3 的重大更新,引入了针对混合专家(MoE)专家的 CPU 卸载功能。此次更新还包括对新发布的 GLM-5.3-Flash 和 Qwen3.8-Flash 模型的支持。
llama.cpp 项目发布了构建版本 b10724,通过按连续运行批次化 scatter 读取,显著提高了恢复非连续 KV 缓存单元的性能。
llama.cpp 项目发布了构建版本 b10721,其中包括对 WebGPU 后端的重大修复,并扩展了 Windows 上的硬件支持。
llama.cpp 项目发布了版本 b10718,其中包含对其 CUDA 后端的重大更新。最显著的变化是将 Mixture of Experts (MOE) 融合扩展到支持推测解码(specdec),解决了之前 MOE glu 融合和 topk-router 融合仅限于一次处理一个 token 的限制。
llama.cpp 项目发布了构建版本 b10715,其中包含对 DFlash 实现的一项关键优化。DFlash 编码器现在在解码期间直接融合到 KV 缓存注入过程中。
llama.cpp 项目发布了构建版本 b10714,其中包括针对 AMD Strix Halo 硬件的 Vulkan 后端的特定优化。该更新调整了矩阵-向量乘法行数,以改进批量推理期间的性能。
llama.cpp 项目发布了构建版本 b10706,为 ggml 后端引入了新功能。此更新包括添加 SWIGLU_CLAMP 以及新的 Vulkan 着色器实现。
llama.cpp 项目发布了版本 b10707,其中包括对键值 (KV) 缓存处理的一项性能优化。该更新修改了 `for_each_token_in` 函数,使其在已遍历特定单元内的所有序列后停止扫描,而不是迭代所有可能的最大序列数。
llama.cpp 项目发布了构建版本 b10688,其中包含一个拉取请求(pull request),为 M2 架构添加了快速向量(fa-vec)调优。
llama.cpp 项目已更新其 OpenCL 后端,以改善两代 Adreno GPU 上的矩阵乘法性能。这些更改主要针对 X2E 代,默认启用 xmem F16xF32 GEMM 路径,并优化了 A7X 代的处理。
llama.cpp 项目发布了版本 b10684,其中包含针对 SYCL 后端的特定修复,使 `--fit` 标志能更准确地尊重 `--fit-target`。
llama.cpp 项目发布了版本 b10670,其中包括针对 Intel Xe2 架构的特定优化。该更新将量化键值 (KV) 解码操作专门路由到 BMG 硬件的 TILE 后端,同时在其他架构验证之前继续使用 VEC 后端。
llama.cpp 项目发布了版本 b10669,其中包括通过就地绑定 f16 KV 缓存来优化 oneDNN SDPA 路径的性能改进。
llama.cpp b10666 版本将 test-save-load-state 套件扩展至在所有架构上运行,并解决了状态管理和图处理中的几个关键错误。主要更改包括修复 minimax-01 中的悬空引用、对齐设备内序列的块复制,以及纠正 deepseek4 的索引器头计数。