llama.cpp b11120 隐藏 Vulkan 内部符号以修复状态销毁问题
llama.cpp 项目发布了版本 b11120,通过隐藏内部符号解决了 Vulkan 后端中的一个关键错误。此更改防止了在导出内部符号时发生的重复 dlopen 状态销毁问题。
llama.cpp 项目发布了版本 b11120,通过隐藏内部符号解决了 Vulkan 后端中的一个关键错误。此更改防止了在导出内部符号时发生的重复 dlopen 状态销毁问题。
研究人员推出了 CliffCompaction,这是一种自动压缩技术,旨在通过截断而非改写的方式保留压缩信息的忠实度,从而在受限上下文条件下将长周期编码智能体的成本降低高达 50%。该方法在 Terminal-Bench 上保持或提升了性能,并在 KernelBench 上取得了最先进结果。
研究人员推出了 CliffCompaction,这是一种专为处理数百万 token 的智能体设计的自动压缩技术,可在有界上下文下将成本降低高达 50%。该方法通过在截断而非改写时保持信息忠实度,在 Terminal-Bench 上维持或提升了性能,并在 KernelBench 上取得了最先进结果。
llama.cpp 项目已发布构建版本 b11118,其中包含一项新的 hex-dma 功能,引入了更适合 Hexagon Vector eXtended (HVX) FA 掩码处理的直接映射 DMA 缓存。
Parallel 已将 OpenAI 的 GPT-6 Astra 集成到其 AI 代理基础设施中,与之前的模型相比,研究时间和代码成本均降低了 50%。该公司表示,新模型使代理能够以显著更快的速度完成复杂的知识工作,同时保持高质量的输出。
llama.cpp 项目发布了 b11111 构建版本,为 Xe-LPG Plus、Xe2 和 Xe3 架构上的 split k 路径引入了基于 Vulkan 的 flash attention 优化内核。
llama.cpp 项目通过暴露目标图中的层输入张量,为 HunyuanOCR 模型添加了针对 DFlash 推测解码的支持。此更改使草稿模型能够读取残差流,从而使图像请求能够成功运行,其草稿接受率约为 0.5,且与非推测运行相比,OCR 输出字节完全一致。
llama.cpp 项目发布了版本 b11104,引入了一项新功能,允许 llama-server 组件同时绑定到多个网络地址。
llama.cpp 项目发布了构建版本 b11102,引入了对转换 MiMo-V2.6 模型的支持。
llama.cpp 项目发布了版本 b11101,其中包含一项构建系统修复,允许对 llama 库重复调用 find_package。
Hugging Face 的 Transformers 库现在支持加载 GGUF 量化模型,利用底层 ggml 内核使性能接近 llama.cpp。此集成允许开发者在支持的硬件上直接在标准的 PyTorch API 中运行量化检查点。
llama.cpp 项目发布了构建版本 b11100,解决了 Muse Glimmer 模型的一个特定解析问题。主要更改涉及修复该模型在执行工具调用期间遇到的第一个解析器错误。
llama.cpp 项目发布了版本 b11097,引入了用于 A8 Q4_0 non-MoE dp4a 格式的 OpenCL 二进制内核。
Jen Wei 在为即将到来的 PyTorch 会议演讲测试 AdamW、Muon 以及 OLMo-core 中最新的 Dion3 实现时,遇到了学习率死亡螺旋。
一名用户计划使用 ilsp/Llama-Krikri-8B-Instruct 检查点构建一个无审查、原生希腊语的大语言模型,以便进行本地部署。拟定的计划涉及使用 Heretic (heretic-llm) 对模型进行消融处理,将其转换为 GGUF Q4_K_M 格式,并在配备 AMD Ryzen AI MAX+ 395 处理器的 GMKtec EVO-X3 上通过 Vulkan 运行推理。
Together AI 推出了金丝雀发布功能,该功能通过分阶段步骤将实时流量从当前模型迁移到新的检查点。该系统通过在转移流量之前运行健康检查和可选指标门控,自动执行模型切换的安全机制,从而在性能下降时允许自动暂停和回滚。
研究人员提出了AgentRouter,这是一种轻量级分类器,通过将单个轨迹步骤路由到合适的模型层级,而非为每个任务都使用前沿模型,从而优化多步智能体工作流。该系统解决了现有解决方案的不足,后者忽略了单个智能体会话内不同子任务的复杂性差异。
llama.cpp b11095 版本引入了针对 HMX 优化的 GATED_DELTA_NET (GDN) 实现,以及针对 Hexagon 和 Flash Attention 内核的各种优化。
研究人员提出了AgentRouter,这是一种轻量级分类器,通过将各个轨迹步骤路由到合适的模型层级,而不是对所有任务使用单一的前沿模型,从而优化多步智能体工作流。该系统解决了企业系统的低效问题,这些系统浪费了60-80%的推理预算在较小模型同样能胜任的子任务上。
llama.cpp 项目发布了版本 b11090,其中包括对 sm_70 tile 编译错误的修复。该更新将 5 参数 load_ldmatrix 函数的 tile 形状泛化,以解决与 Volta 架构的不匹配问题。