llama.cpp b11120 隐藏 Vulkan 内部符号以修复状态销毁问题
llama.cpp 项目发布了版本 b11120,通过隐藏内部符号解决了 Vulkan 后端中的一个关键错误。此更改防止了在导出内部符号时发生的重复 dlopen 状态销毁问题。
llama.cpp 项目发布了版本 b11120,通过隐藏内部符号解决了 Vulkan 后端中的一个关键错误。此更改防止了在导出内部符号时发生的重复 dlopen 状态销毁问题。
llama.cpp 项目已发布构建版本 b11118,其中包含一项新的 hex-dma 功能,引入了更适合 Hexagon Vector eXtended (HVX) FA 掩码处理的直接映射 DMA 缓存。
llama.cpp 项目通过暴露目标图中的层输入张量,为 HunyuanOCR 模型添加了针对 DFlash 推测解码的支持。此更改使草稿模型能够读取残差流,从而使图像请求能够成功运行,其草稿接受率约为 0.5,且与非推测运行相比,OCR 输出字节完全一致。
llama.cpp 项目发布了版本 b11104,引入了一项新功能,允许 llama-server 组件同时绑定到多个网络地址。
llama.cpp 项目发布了构建版本 b11102,引入了对转换 MiMo-V2.6 模型的支持。
Hugging Face 的 Transformers 库现在支持加载 GGUF 量化模型,利用底层 ggml 内核使性能接近 llama.cpp。此集成允许开发者在支持的硬件上直接在标准的 PyTorch API 中运行量化检查点。
oMLX 的创建者和维护者 Jun Kim 已加入 Hugging Face,以支持 MLX 社区。此举旨在通过将该项目从副业转变为完全维护和资助的计划,为开源项目提供稳定性和更快的开发速度。
一名用户计划使用 ilsp/Llama-Krikri-8B-Instruct 检查点构建一个无审查、原生希腊语的大语言模型,以便进行本地部署。拟定的计划涉及使用 Heretic (heretic-llm) 对模型进行消融处理,将其转换为 GGUF Q4_K_M 格式,并在配备 AMD Ryzen AI MAX+ 395 处理器的 GMKtec EVO-X3 上通过 Vulkan 运行推理。
llama.cpp 项目发布了版本 b11090,其中包括对 sm_70 tile 编译错误的修复。该更新将 5 参数 load_ldmatrix 函数的 tile 形状泛化,以解决与 Volta 架构的不匹配问题。
llama.cpp 项目已发布构建版本 b11081,其中包含对 `test-llama-archs` 测试基础设施的几项更新。主要更改包括使张量数据标准偏差可配置、扩展使用示例以及添加对架构正则表达式模式的支持。
llama.cpp 项目发布了构建版本 b11074,其中包含对 JSON enum 处理的修复。更新为 enum 值添加了 common_json_value 支持,并通过将 enum 构造函数委托给底层类型的构造函数来简化代码。
llama.cpp 项目发布了构建版本 b11067,其中为 WebGPU 后端引入了融合的 GDN + 复制操作。
llama.cpp 项目发布了构建版本 b11060,其中包括对 Mamba 模型的修复,以确保时间步投影输入是连续的。此更改解决了 Mamba 实现中的内存布局问题。
llama.cpp 项目发布了版本 b11054,增加了对 Qualcomm Hexagon DSP 上 TOP_K 算子的支持。此次更新包括针对单行处理的优化以及对行划分的修复。
llama.cpp 项目发布了版本 b11055,引入了对 Hexagon DSP 上 GEGLU_QUICK 激活函数的支持。
llama.cpp 项目发布了版本 b11053,其中包含对服务器启动日志消息的特定改进。此更改通过用明确来源标签替换晦涩标记,增强了对模型加载方式的可见性。
llama.cpp 项目发布了构建版本 b11048,引入了对 qwen4exp 使用的新 DSV4 HC 操作变体的支持。此更新包括针对带有逐元素 sigmoid 门的 hc_pre 和带有恒等混合的 hc_post 的具体实现。
Celestium CARE 的 NVIDIA 版本已完成,并作为专业工具面向 GTX 和 RTX 显卡提供。它利用 NVML 提供 VRAM 清理、自动清理计划以及完整的遥测监控等功能。
llama.cpp 项目发布了版本 b11046,其中引入了对 `flash_attn_f32_f16_bin` 内核的 OpenCL 支持。此更新还包括在 OpenCL 设备上为 Flash Attention 提供的受保护预填充功能。
llama.cpp 项目发布了版本 b11042,引入了针对非 MoE 模型的 A8 Q6_K 新 OpenCL 二进制内核。此更新还包括修复 OpenCL 后端内的布局兼容性问题。