llama.cpp b10435 修复了 jinja gather_string_parts 中的二次方成本
llama.cpp 项目发布了版本 b10435,解决了 Jinja 模板引擎内的性能问题。主要更改修复了 `gather_string_parts` 函数中的二次时间复杂度错误。
llama.cpp 项目发布了版本 b10435,解决了 Jinja 模板引擎内的性能问题。主要更改修复了 `gather_string_parts` 函数中的二次时间复杂度错误。
llama.cpp 项目发布了构建版本 b10434,增加了对将 `reasoning_effort` 参数传递到 Jinja 模板的支持。此更改确保 OpenAI Chat Completions 的 `reasoning_effort` 值在生成期间被存储并可访问。
llama.cpp 项目发布了版本 b10431,在 ggml_ssm_scan 操作中引入了对循环状态 (RS) 回滚的支持。此更改使 Nemotron 模型能够在 CPU 和 CUDA 后端上实现 RS 回滚。
llama.cpp 项目发布了版本 b10429,该版本修改了服务器,使其在 llama_decode() 执行期间允许访问 /metrics 和 /slots 端点。
llama.cpp 项目发布了版本 b10430,引入了对虚拟集成 GPU (igpu) 设备的支持。此更新还包括代码库中改进的注释。
llama.cpp 项目发布了版本 b10427,其中包括通过 SYCL 针对 Intel Arc GPU 的性能优化。该更新实现了在 q4_K 密集前馈网络 (FFN) 层内对 gate、up 和 GLU 操作的融合。
llama.cpp 项目已发布版本 b10425,其中包括将 SYCL 优化移植到融合 gated-delta-net 状态回写副本。
llama.cpp 项目发布了 b10418 版本,引入了对主机固定内存的支持,以改善 SYCL 主机到设备的内存访问。此更新解决了后端实现中的线程安全问题。
llama.cpp 项目已将其 OpenVINO 后端的重大更新合并,主要启用了针对 Qwen3.5 模型系列的支持,并引入了多项内存优化技术。
llama.cpp 项目发布了构建版本 b10416,解决了 llama.app 网站上的缓存问题,该问题导致 index.html 文件因不可变标头而被锁定在旧构建上。
llama.cpp 项目发布了版本 b10413,该版本引入了直接从草稿 GGUF 模型元数据中自动检测推测解码规范类型的功能。
llama.cpp 项目发布了构建版本 b10414,在 Metal 后端引入了对 GGML_TYPE_TQ2_0 三元量化的支持。此更新还包括对连续张量 (cont) mul_mv 内核的优化。
llama.cpp 项目发布了版本 b10412,引入了对 dflash 和 dspark 后端的支持。此更新还允许在后端采样逻辑中使用大于 0 的 p_min 值,并添加了相应的保护措施。
llama.cpp 项目发布了版本 b10410,其中包含对 SYCL 后端的代码更改。此更新移除了 GEMM non-oneDNN 路径中的单独 fp32 类型提升,改为使用自动 fp16 提升。
llama.cpp 项目发布了 b10408 版本,引入了用于 Intel GPU 的 DMMV Q3_K ESIMD 内核。此版本还包括新的 Q4_K 和 Q6_K ESIMD 内核,并对代码库进行了重构,以允许在运行时而非编译时控制 ESIMD。
llama.cpp 项目发布了构建版本 b10369,引入了对 pocket-tts 文本转语音模型的支持。此更新包含使用 GEMM 和 col2im 实现转置卷积的新方法,以优化性能。
llama.cpp b10361 版本解决了一个关键错误,由于加载期间参数顺序不正确,导致 LGAI-EXAONE 4.5 模型未启用滑动窗口注意力(SWA)。
llama.cpp 项目已发布版本 b10356,主要目标是构建基础设施,将 ROCm 后端从版本 7.2.1 切换至 7.14。此更新与 ROCm 7.14 成为首个使用 TheRock 构建系统的生产版本相一致,并将 CI 作业迁移为在 Linux 和 Windows 上使用多架构 wheel。
llama.cpp 项目发布了版本 b10355,引入了对多输出后端采样的支持。此更新启用了结合令牌推测的后端采样,并添加了数值上下文参数以声明每个序列的最大输出数。
llama.cpp 项目发布了构建版本 b10353,解决了 CUDA 和 Metal 后端中 ggml_roll 操作的一个关键 bug。此前,由于这些后端忽略了步幅信息,置换(非连续)源张量会无声地产生错误结果。