llama.cpp 项目发布了构建版本 b10737,解决了 qwen4exp 架构支持中的关键错误。此次更新解决了序列状态持久性问题,并防止在模型加载期间出现 CUDA 中止。

  • 修复了 kvu NaN 崩溃,并在 qwen4exp 模型的保存/恢复往返过程中恢复了 ext.x/ext.y 索引器缓存数据。
  • 修正了 per_layer_token_embd 行数推导,并拒绝 PLE 循环缓存层中的空指针解引用。
  • 禁用了 qwen4exp 的 -sm tensor 标志,该标志此前会导致 NaN logits 并在真实设备上引发崩溃。
  • 将 seq_set 重命名为 seq_get_all 以解决函数重载冲突,并添加了验证状态完整性的测试。

这些更改确保 qwen4exp 模型可以在没有数据损坏或运行时错误的情况下加载和保存,特别是在使用 2D mrope 内容或 PLE 层时。