llama.cpp 项目发布了 0.1.2 版本,其中包括与 ggml 的同步(已更新至 0.20.2)以及对服务器和 UI 组件的几项更新。

  • CUDA:在 DGX Spark 上针对密集模型的 bs=1 使用 MMVQ nwarps=8。
  • mtmd:使用 sha256 进行输入哈希处理。
  • vocab:支持整数分词器分数。
  • mtmd:跳过非平铺 LFM2 图像的缩略图。
  • server:将处理后的 mtmd 块保存为占位符。
  • ui:强制执行枚举成员的字母顺序并重构内置工具命名。

此版本还解决了 xcframework + cmake 的构建清理问题,并更新了预发布生成的 CI 流程。