Joakimpalm-Zen 已更新 Xyntetik Runner,使其能够直接使用其用于推理的相同量化 GGUF 权重来训练 LoRA 适配器,从而无需单独的 FP16 训练副本或运行时。
- 针对冻结的 Qwen3-4B Q4_K_M GGUF 训练了一个工具使用 LoRA,在保留评估中实现了精确工具调用和正确工具选择的 1.00 准确率。
- 使用相同的基座 GGUF、数据集、种子和配置进行的两次独立运行生成了字节完全相同的适配器 GGUF,且 SHA256 哈希值匹配。
- 对 BF16、Q8_0 和 Q4_K_M 量化的比较显示,虽然所有量化均达到了 1.00 的准确率,但通过 Q4 进行的训练遵循了与高精度版本可测量的不同优化路径(余弦相似度为 0.9926)。
作者在 Hugging Face 上提供了完整的可复现性工件,但指出该实验仅限于具有少量数据的狭窄合成任务,主要旨在展示训练机制和确定性特性,而非通用能力的提升。