llama.cpp 版本 b9741 为 macOS、Linux、Android、Windows 和 openEuler 引入了适用于多种架构的新二进制文件。该版本包含对 Vulkan、CUDA 12.4 和 13.3、OpenVINO、SYCL 以及 ROCm 的支持,并更新了 iOS 和 Ubuntu 的版本。
github
llama.cpp
·
76 天前
·
inference
llama.cpp b9741 版本发布新增二进制文件与支持
译自 English → 中文
相关文章
github
llama.cpp
·
76 天前
·
13 次浏览
ggml 通过分区展平优化 AMX
ggml 项目通过将 n_batch * M 上的分区展平,优化了 AMX 性能,确保所有线程都参与量化。这一改进在 CPU 和 GPU 平台上的各种模型和硬件配置中,将速度提升了最高 1.47 倍,结果显示推理时间一致缩短。
github
llama.cpp
·
76 天前
ggml-webgpu 为 Vulkan 和 NVIDIA 添加 F16 适配器切换
ggml-webgpu 项目已为 Vulkan 和 NVIDIA GPU 添加了半精度 (F16) 支持的适配器切换。此更新提升了在 macOS、Linux、Android、Windows 和 openEuler 等多个平台上兼容硬件的性能,并提供针对 ARM 和 x64 架构的特定构建版本。
github
llama.cpp
·
76 天前
·
3 次浏览
LLaMA.cpp 发布 b9729:新二进制文件和平台支持
LLaMA.cpp 发布了版本 b9729,提供适用于 macOS、Linux、Android、Windows 和 openEuler 的二进制文件,涵盖多种架构。该版本包括对 CPU、Vulkan、OpenVINO、SYCL 和 ROCm 的支持,以及一个新的 UI 包。内部对 'webui' 的引用已被移除。
github
llama.cpp
·
78 天前
·
8 次浏览
llama.cpp 发布 b9703:更新与二进制下载
llama.cpp 版本 b9703 包括对服务器预设处理的重新设计,移除了远程 HF 预设支持和已弃用的函数。该版本提供了适用于 macOS、Linux、Android、Windows 和 openEuler 的二进制文件,涵盖多种架构和硬件加速选项,包括 Vulkan、CUDA、OpenVINO 和 SYCL。
github
llama.cpp
·
79 天前
·
3 次浏览
Metal后端为concat算子添加f16和bf16支持
llama.cpp中的Metal后端已扩展,以支持concat算子的f16和bf16张量类型,此外还保留现有的f32和i32支持。此更新包括专用的内核模板、更新的管道获取器以及改进的基于类型的内核分发,并得到了pi:llama.cpp/Qwen3.6-27B的帮助。