← 返回 github vLLM · 2 天前 · inference v0.29.0rc5 将 Mamba 的 prefix_cache_retention_interval 默认值更改为 dense 译自 English → 中文 v0.29.0rc5 版本将 `prefix_cache_retention_interval` 参数的默认值更新为 `dense`,专门针对 Mamba 模型。 该更改针对核心系统中的 Mamba 架构。它通过将保留间隔设置为 dense 来修改缓存行为。 重要性 1/3 可信度 2/3 vLLM Inference efficiency 阅读原文 相关文章 github llama.cpp · 刚刚 实时 llama.cpp b10891 通过回退到共享内存归约修复 PowerVR Vulkan 崩溃 llama.cpp 项目发布了 b10891 版本,解决了 PowerVR GPU 上的一个关键稳定性问题。该更新修改了 Vulkan 后端,使其在去量化矩阵-向量乘法(dmmv)操作中回退到共享内存归约。 media MarkTechPost · 刚刚 实时 DeepSeek 发布 DeepSeek-V4.1-Flash,支持 1M 上下文与 FP4 KV 缓存 DeepSeek AI 发布了 DeepSeek-V4.1-Flash,这是一款多模态混合专家模型,具备 100 万 token 的上下文窗口和 FP4 KV 缓存,将全局缓存占用降低至每 token 890 字节。该模型采用因果编码器-解码器架构以及压缩稀疏注意力 2(CSA2),在保持性能的同时显著降低了内存需求。 github llama.cpp · 1 小时前 · 1 次浏览 实时 llama.cpp b10889 版本避免为索引器分配 V 缓存 llama.cpp 项目发布了构建版本 b10889,其中包括一项内存优化,以避免为未使用的索引器分配 V 缓存。 github llama.cpp · 3 小时前 · 1 次浏览 llama.cpp b10888 为 GPU 分析器添加 Vulkan 命令缓冲区调试标签 llama.cpp 项目发布了构建版本 b10888,其中包含一项新功能,可在 Vulkan 后端为 GPU 分析器添加命令缓冲区调试标签。 github llama.cpp · 4 小时前 · 1 次浏览 llama.cpp b10886 为 s390x 添加 Q1_0 向量内置支持 llama.cpp 项目发布了构建版本 b10886,引入了对 s390x 架构的 Q1_0 向量内置支持。此更新包括 `ggml_vec_dot_q1_0_q8_0` 的实现,并更新了文档以反映新功能。
github llama.cpp · 刚刚 实时 llama.cpp b10891 通过回退到共享内存归约修复 PowerVR Vulkan 崩溃 llama.cpp 项目发布了 b10891 版本,解决了 PowerVR GPU 上的一个关键稳定性问题。该更新修改了 Vulkan 后端,使其在去量化矩阵-向量乘法(dmmv)操作中回退到共享内存归约。
media MarkTechPost · 刚刚 实时 DeepSeek 发布 DeepSeek-V4.1-Flash,支持 1M 上下文与 FP4 KV 缓存 DeepSeek AI 发布了 DeepSeek-V4.1-Flash,这是一款多模态混合专家模型,具备 100 万 token 的上下文窗口和 FP4 KV 缓存,将全局缓存占用降低至每 token 890 字节。该模型采用因果编码器-解码器架构以及压缩稀疏注意力 2(CSA2),在保持性能的同时显著降低了内存需求。
github llama.cpp · 1 小时前 · 1 次浏览 实时 llama.cpp b10889 版本避免为索引器分配 V 缓存 llama.cpp 项目发布了构建版本 b10889,其中包括一项内存优化,以避免为未使用的索引器分配 V 缓存。
github llama.cpp · 3 小时前 · 1 次浏览 llama.cpp b10888 为 GPU 分析器添加 Vulkan 命令缓冲区调试标签 llama.cpp 项目发布了构建版本 b10888,其中包含一项新功能,可在 Vulkan 后端为 GPU 分析器添加命令缓冲区调试标签。
github llama.cpp · 4 小时前 · 1 次浏览 llama.cpp b10886 为 s390x 添加 Q1_0 向量内置支持 llama.cpp 项目发布了构建版本 b10886,引入了对 s390x 架构的 Q1_0 向量内置支持。此更新包括 `ggml_vec_dot_q1_0_q8_0` 的实现,并更新了文档以反映新功能。