llama.cpp b11298 添加了对 dflash 格式转换和特征提取的支持
llama.cpp 项目发布了构建版本 b11298,引入了对 dflash 格式的支持。此更新支持将模型转换为该格式以及后续的特征提取功能。
llama.cpp 项目发布了构建版本 b11298,引入了对 dflash 格式的支持。此更新支持将模型转换为该格式以及后续的特征提取功能。
llama.cpp 项目发布了构建版本 b11284,其中包含针对 OpenVINO 后端的修复,以正确处理量化权重视图上的 GET_ROWS 操作。
llama.cpp 项目发布了版本 b11280,其中包括通过使用固定主机缓冲区来减少张量 allreduce 同步的更改。
llama.cpp 项目发布了构建版本 b11282,其中包括为 MUSA 设备传递定义 `CUDA_ARCH` 宏的修复。此前,MUSA 供应商头文件未能定义此变量,导致共享 ggml-cuda 源代码中的架构测试评估为零,从而产生空的内核体。
llama.cpp 项目已添加对 GLM-5.3-Flash (GLM5-Next) 模型架构的初步支持,包括迁移到混合索引内存以及早期的多令牌预测 (MTP) 功能。
llama.cpp 项目发布了构建版本 b11273,引入了对重排序模型中 `classifier_pooling` 方法的支持,专门针对 ModernBERT 架构。
llama.cpp 项目发布了构建版本 b11272,其中包括针对 Hexagon 后端的优化。主要更改集中在优化连接操作,以提高 Qualcomm Snapdragon 硬件上的性能。
llama.cpp 项目发布了构建版本 b11266,其中包含一项 Vulkan 优化:当数据满足 2 字节对齐时,每次加载两个元素的 F32 A 矩阵。此更改解决了 Intel 硬件上逐个加载浮点数效率低下的性能问题,并修正了原始补丁中缺失的 `a_offset` 对齐验证。
llama.cpp b11265 版本包含对 Vulkan 后端处理混合专家(MoE)模型的修复。该更新修正了 `mat_mul_id` 选择矩阵乘法图块的方式,解决了在分发期间工作线程空闲的性能问题。
llama.cpp 项目发布了 b11260 版本,在 Hexagon 后端引入了对 FP32 GELU_ERF 和 GEGLU_ERF 激活函数的支持。此更新还包括优化以减少相关内核中的寄存器压力。
llama.cpp 项目发布了构建版本 b11258,其中包含对内置 Web 界面 service worker 行为的修复。此前,使用 `--path` 或 `--no-ui` 等标志会导致浏览器保留界面的缓存版本,因为服务器为 `/sw.js` 返回了 404,这不会触发 service worker 的移除。
llama.cpp 项目发布了构建版本 b11254,其中包含对计算图中输入张量收集方式的修复。此前,`graph_inputs` 在图拆分期间被填充,导致在流水线并行中出现因切换消耗不同输入的批次而引发的虚假后端 ID 比较,并强制调度器重新预留资源。
llama.cpp 服务器现在支持 /v1/embeddings 端点的类型化内容(视觉、音频、视频)输入。此更新通过接受 OpenAI 风格的包装内容数组,使多模态嵌入请求成为可能,允许文本和 image_url 部分一起处理。
llama.cpp 项目发布了构建版本 b11238,通过新增的 `ggml_pad_ext` 函数引入了统一的左侧填充实现。此更改整合了 Parakeet、LFM2-Audio、Granite Speech 和 Gemma 4 等音频编码器之前使用的方法,确保 Gemma 4 的嵌入向量位级一致,同时简化了后端支持。
llama.cpp 项目发布了构建版本 b11232,其中包括对 ggml-cpu 后端的更新。此次发布重点在于为 x86 架构上的非向量倍数头维度启用分块 flash attention。
llama.cpp b11228 版本在 Metal 后端的 GGML_OP_PAD 操作中引入了对左侧和循环填充的支持,使其与 CPU、CUDA 和 Vulkan 实现保持一致。此更改修复了置换源上的右侧填充问题,并确保在不同硬件后端之间行为一致。
llama.cpp 项目发布了构建版本 b11227,其中包括专门针对多模态处理期间 `causal_attn` 标志处理的性能优化。
llama.cpp b11224 版本解决了 Vulkan 后端中矩阵乘法操作读取较大、带步长的张量(如 KV 缓存)切片时计算结果不正确的问题。
llama.cpp 服务器现在允许对 Qwen3 和 Qwen3-VL 等因果 LLM 重排序器使用 RANK pooling batch splitting,解决了之前破坏长文档和多模态重排序的限制。
llama.cpp b11216 版本在 SYCL 后端中引入了支持大于 512 的块宽度的快速沃尔什-哈达玛变换 (FWHT) 内核。此前,更大的宽度会回退到具有 O(n^2) 复杂度的密集 GEMM;此更改使这些尺寸能够实现 O(n log n) 的性能。