CUDA 实现已更新,以优先采用 FlashAttention 的整块调度策略。此更改旨在优化框架内注意力机制的执行流程。
github
llama.cpp
·
2 小时前
·
inference
CUDA 偏好 FlashAttention 的整块调度
译自 English → 中文
相关文章
media
Hugging Face Forums
·
4 小时前
·
13 次浏览
Eqx-zoo 提供经验证的 Hugging Face 模型的 Equinox 端口
作者构建了 eqx-zoo,这是一个库,可以直接将 Hugging Face Hub 的检查点加载为普通的 Equinox 模块,并针对 transformers 库验证每个模型。该项目目前支持用于生成的 Llama、Qwen2、Qwen3、Qwen3-MoE,以及用于嵌入的 BERT、RoBERTa、XLM-RoBERTa。
github
llama.cpp
·
4 小时前
·
3 次浏览
llama.cpp b11401 版本修复了日志记录问题并在 Windows 上启用了 ANSI 颜色
llama.cpp b11401 版本解决了服务器路由器模式下的日志记录问题,并为 Windows 控制台添加了 ANSI 颜色支持。此更新确保子进程日志与状态命令正确分离,并在 Windows 终端中正确渲染彩色输出。
media
MarkTechPost
·
15 小时前
·
27 次浏览
Aleph Alpha 发布 Kolibri,一款拥有 78.1B 英德双语 MoE 模型及 3.46B 激活参数
Aleph Alpha 发布了 Kolibri-1,这是一款专为英德双语任务设计的开源权重混合专家语言模型。该模型总共包含 781 亿个参数,但每个 token 仅激活 34.6 亿个,使其能够在单张 B200、B300 或 H200 GPU 上运行。
github
llama.cpp
·
16 小时前
·
28 次浏览
llama.cpp b11390 修复 CUDA MMQ 内存故障
llama.cpp 项目发布了版本 b11390,其中包含对 CUDA MMQ 内存故障的修复,该故障发生在专家数量显著大于微批次大小时。
github
llama.cpp
·
1 天前
·
17 次浏览
llama.cpp b11382 为 WebGPU fill/set_rows 添加 f16 支持
llama.cpp 项目发布了构建版本 b11382,其中包含对其 WebGPU 后端的重大更新。此版本专门为 WebGPU 实现中的 `fill` 和 `set_rows` 操作添加了 16 位浮点数 (f16) 支持。