vLLM 项目发布了 0.29.0 版本,其中包括关于密集前缀缓存的核心错误修复。
- 该更新专门针对混合模型应用了密集前缀缓存的默认设置。
vLLM 项目发布了 0.29.0 版本,其中包括关于密集前缀缓存的核心错误修复。
llama.cpp 项目发布了 b10891 版本,解决了 PowerVR GPU 上的一个关键稳定性问题。该更新修改了 Vulkan 后端,使其在去量化矩阵-向量乘法(dmmv)操作中回退到共享内存归约。
DeepSeek AI 发布了 DeepSeek-V4.1-Flash,这是一款多模态混合专家模型,具备 100 万 token 的上下文窗口和 FP4 KV 缓存,将全局缓存占用降低至每 token 890 字节。该模型采用因果编码器-解码器架构以及压缩稀疏注意力 2(CSA2),在保持性能的同时显著降低了内存需求。
llama.cpp 项目发布了构建版本 b10889,其中包括一项内存优化,以避免为未使用的索引器分配 V 缓存。
llama.cpp 项目发布了构建版本 b10888,其中包含一项新功能,可在 Vulkan 后端为 GPU 分析器添加命令缓冲区调试标签。
llama.cpp 项目发布了构建版本 b10886,引入了对 s390x 架构的 Q1_0 向量内置支持。此更新包括 `ggml_vec_dot_q1_0_q8_0` 的实现,并更新了文档以反映新功能。
我们使用 Cookie 来统计访问量并改进网站。您可以接受或拒绝分析 Cookie。 隐私政策