← 返回 github vLLM · 1 小时前 · inference vLLM v0.28.0rc2 添加了带有局部卷积和候选选择器的 DFlash2 Spec Decode 译自 English → 中文 vLLM 项目发布了 0.28.0rc2 版本,其中包括 DFlash2 推测解码功能。 DFlash2 实现了用于高效令牌生成的局部卷积机制。此次更新引入了专用的候选选择器以改进 spec decode 过程。此更改是从提交 b389ac2 中 cherry-picked 的,并由 khluu 签署。 重要性 1/3 可信度 2/3 vLLM Inference efficiency 阅读原文 相关文章 github llama.cpp · 4 小时前 · 1 次浏览 llama.cpp b10539 修复了 Vulkan FA MMQ 溢出并增加了对 Windows CUDA 13 的支持 llama.cpp 项目发布了版本 b10539,解决了 Vulkan 后端中的一个关键数值稳定性问题,同时扩展了 Windows 用户的硬件支持。 github llama.cpp · 4 小时前 · 1 次浏览 llama.cpp b10541 为多模态项目添加了 --mmproj-device 参数 llama.cpp 项目发布了构建版本 b10541,引入了 `--mmproj-device` 命令行参数,允许用户指定用于加载多模态投影文件的设备后端。 github llama.cpp · 4 小时前 · 1 次浏览 llama.cpp b10545 修复了 Metal matmul 中 K 不是 32 的倍数时的越界读取问题 llama.cpp 项目发布了构建版本 b10545,解决了 Metal 后端张量 API 矩阵乘法内核中的一个关键错误。该更新防止在处理 K 维度不是 32 的倍数的张量时出现未定义行为和损坏的结果。 github llama.cpp · 5 小时前 · 1 次浏览 llama.cpp b10534 添加针对硬件的 CUDA 切换点以加速解码 llama.cpp 项目发布了构建版本 b10534,引入了特定于硬件的切换点,以在 CUDA 上的量化解码过程中调整向量路径与张量核心路径之间的交叉。 github llama.cpp · 6 小时前 · 1 次浏览 llama.cpp b10538 发布,支持针对大批量的去量化 KV 缓存 llama.cpp 项目发布了版本 b10538,在 metal 后端引入了关键优化。此更新仅针对大批量大小启用键值 (KV) 缓存的去量化。
github llama.cpp · 4 小时前 · 1 次浏览 llama.cpp b10539 修复了 Vulkan FA MMQ 溢出并增加了对 Windows CUDA 13 的支持 llama.cpp 项目发布了版本 b10539,解决了 Vulkan 后端中的一个关键数值稳定性问题,同时扩展了 Windows 用户的硬件支持。
github llama.cpp · 4 小时前 · 1 次浏览 llama.cpp b10541 为多模态项目添加了 --mmproj-device 参数 llama.cpp 项目发布了构建版本 b10541,引入了 `--mmproj-device` 命令行参数,允许用户指定用于加载多模态投影文件的设备后端。
github llama.cpp · 4 小时前 · 1 次浏览 llama.cpp b10545 修复了 Metal matmul 中 K 不是 32 的倍数时的越界读取问题 llama.cpp 项目发布了构建版本 b10545,解决了 Metal 后端张量 API 矩阵乘法内核中的一个关键错误。该更新防止在处理 K 维度不是 32 的倍数的张量时出现未定义行为和损坏的结果。
github llama.cpp · 5 小时前 · 1 次浏览 llama.cpp b10534 添加针对硬件的 CUDA 切换点以加速解码 llama.cpp 项目发布了构建版本 b10534,引入了特定于硬件的切换点,以在 CUDA 上的量化解码过程中调整向量路径与张量核心路径之间的交叉。
github llama.cpp · 6 小时前 · 1 次浏览 llama.cpp b10538 发布,支持针对大批量的去量化 KV 缓存 llama.cpp 项目发布了版本 b10538,在 metal 后端引入了关键优化。此更新仅针对大批量大小启用键值 (KV) 缓存的去量化。