llama.cpp 项目发布了构建版本 b10293,其中包括为 gfx1151 架构引入 AMD ROCm 持续集成,并解决了集成式 RDNA3.5 GPU 上的正确性问题。
- 通过允许调试断言中的集成 GPU 主机输出缓冲区,修复了 gfx1151 上的 test-recurrent-state-rollback。
- 通过启用统一内存以绕过 mmap 加载权重的 GPU 一致性问题的方式,恢复了 RDNA3.5 的推理正确性。
- 通过使用 HIP_LAUNCH_BLOCKING=1 序列化内核启动,解决了 HIP 路径中的异步执行错误。
- 由于不支持的操作和不正确的输出,跳过了 HIP 后端上的 jamba 架构测试和 top-k 子测试。
此更新通过 ROCm 实现了在 AMD RDNA3.5 硬件上对 llama.cpp 模型进行可靠的测试和推理。