llama.cpp 项目发布了版本 b11205,对其 CUDA 后端引入了特定更新。此版本在 SSM 扫描实现中增加了对 Nemotron 3 Puzzle 状态大小 96 的支持。

  • 该更新使 CUDA 硬件能够处理具有 96 拼图状态大小的 Nemotron 3 模型。
  • 提供适用于 macOS(Apple Silicon 和 Intel)、Linux(CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL、Snapdragon)、Windows(CPU、CUDA、Vulkan、OpenVINO、SYCL、ROCm)、Android 和 iOS 的二进制文件。
  • 发布版本包含标准 UI 二进制文件以及特定平台的可执行文件。

此更新允许用户使用 llama.cpp 在兼容的 NVIDIA GPU 上运行具有特定状态大小的 Nemotron 3 模型。