webgpu 组件已添加对 MMVQ(多模向量量化)格式的支持,具体包括 Q1_0、Q5_0、Q5_1、Q3_K、Q5_K、Q6_K 和 MXFP4。
此更新解决了 llama.cpp 仓库中的 #29 问题,以扩展 webgpu 环境内的量化能力。
webgpu 组件已添加对 MMVQ(多模向量量化)格式的支持,具体包括 Q1_0、Q5_0、Q5_1、Q3_K、Q5_K、Q6_K 和 MXFP4。
此更新解决了 llama.cpp 仓库中的 #29 问题,以扩展 webgpu 环境内的量化能力。
作者构建了 eqx-zoo,这是一个库,可以直接将 Hugging Face Hub 的检查点加载为普通的 Equinox 模块,并针对 transformers 库验证每个模型。该项目目前支持用于生成的 Llama、Qwen2、Qwen3、Qwen3-MoE,以及用于嵌入的 BERT、RoBERTa、XLM-RoBERTa。
作者发布了 AiiStream Q3.6,这是一种开源技术,允许 Qwen3.6-35B-A3B 模型在仅配备 8 到 16 GB 内存的 Apple Silicon 设备上运行。通过将路由专家保留在 SSD 上并使用早期加载预测,该方法将 MLX 内存使用量降低至约 1.7 GB,同时保持与标准 mlx_lm 实现完全一致的字节级输出。
llama.cpp 项目发布了构建版本 b11307,修复了层输入顺序,以在推测解码期间保留原始批次序列。此更改确保未掩码 NextN 嵌入的 token 顺序得到正确维护,并与张量分割兼容。
llama.cpp 项目发布了构建版本 b11301,其中包含对 ggml 和 gguf 组件中整数溢出问题的修复。此更新改进了验证逻辑,以防止在处理零元素张量时出现潜在错误。
llama.cpp 项目发布了构建版本 b11302,解决了 CI 流水线中由 ThreadSanitizer 识别出的关键并发问题。此次更新修复了稀疏注意力机制中的数据竞争,此前多个 CPU 线程会错误地写入相同的内存元素。
我们使用 Cookie 来统计访问量并改进网站。您可以接受或拒绝分析 Cookie。 隐私政策