← 返回 github llama.cpp · 5 天前 · inference llama.cpp 为 OpenCL 添加 A8 Q8_0 non-MoE dp4a 二进制内核 译自 English → 中文 llama.cpp 项目已为 OpenCL 添加了 A8 Q8_0 non-MoE dp4a 二进制内核。 该更改在 ggml-org/llama.cpp 仓库中作为拉取请求 #29439 进行跟踪。它在 OpenCL 后端中引入了对特定量化格式 (A8 Q8_0) 的支持,使用 dp4a 指令集。 重要性 1/3 可信度 1/3 llama.cpp Inference efficiency 阅读原文 相关文章 github llama.cpp · 刚刚 实时 llama.cpp b11302 修复稀疏索引器中的 ThreadSanitizer 数据竞争 llama.cpp 项目发布了构建版本 b11302,解决了 CI 流水线中由 ThreadSanitizer 识别出的关键并发问题。此次更新修复了稀疏注意力机制中的数据竞争,此前多个 CPU 线程会错误地写入相同的内存元素。 github llama.cpp · 1 小时前 · 1 次浏览 实时 llama.cpp b11298 添加了对 dflash 格式转换和特征提取的支持 llama.cpp 项目发布了构建版本 b11298,引入了对 dflash 格式的支持。此更新支持将模型转换为该格式以及后续的特征提取功能。 media Hugging Face Forums · 1 小时前 · 1 次浏览 实时 ThermaCompute AI 发布 CrashLens,用于本地 GPU 崩溃日志分类 ThermaCompute AI 发布了 CrashLens,这是一款免费的本地工具,旨在通过分析日志文件帮助工程师调查 GPU 崩溃。该工具在日志中识别已知的故障模式,并建议具体的后续调查步骤。 github llama.cpp · 8 小时前 · 2 次浏览 llama.cpp b11284 修复了量化权重视图上 OpenVINO GET_ROWS 的问题 llama.cpp 项目发布了构建版本 b11284,其中包含针对 OpenVINO 后端的修复,以正确处理量化权重视图上的 GET_ROWS 操作。 github llama.cpp · 9 小时前 · 1 次浏览 llama.cpp b11280 发布通过固定主机缓冲区减少张量 allreduce 同步 llama.cpp 项目发布了版本 b11280,其中包括通过使用固定主机缓冲区来减少张量 allreduce 同步的更改。
github llama.cpp · 刚刚 实时 llama.cpp b11302 修复稀疏索引器中的 ThreadSanitizer 数据竞争 llama.cpp 项目发布了构建版本 b11302,解决了 CI 流水线中由 ThreadSanitizer 识别出的关键并发问题。此次更新修复了稀疏注意力机制中的数据竞争,此前多个 CPU 线程会错误地写入相同的内存元素。
github llama.cpp · 1 小时前 · 1 次浏览 实时 llama.cpp b11298 添加了对 dflash 格式转换和特征提取的支持 llama.cpp 项目发布了构建版本 b11298,引入了对 dflash 格式的支持。此更新支持将模型转换为该格式以及后续的特征提取功能。
media Hugging Face Forums · 1 小时前 · 1 次浏览 实时 ThermaCompute AI 发布 CrashLens,用于本地 GPU 崩溃日志分类 ThermaCompute AI 发布了 CrashLens,这是一款免费的本地工具,旨在通过分析日志文件帮助工程师调查 GPU 崩溃。该工具在日志中识别已知的故障模式,并建议具体的后续调查步骤。
github llama.cpp · 8 小时前 · 2 次浏览 llama.cpp b11284 修复了量化权重视图上 OpenVINO GET_ROWS 的问题 llama.cpp 项目发布了构建版本 b11284,其中包含针对 OpenVINO 后端的修复,以正确处理量化权重视图上的 GET_ROWS 操作。
github llama.cpp · 9 小时前 · 1 次浏览 llama.cpp b11280 发布通过固定主机缓冲区减少张量 allreduce 同步 llama.cpp 项目发布了版本 b11280,其中包括通过使用固定主机缓冲区来减少张量 allreduce 同步的更改。