名为 QuantCheck 的新工具强调,预训练的最终检查点可能不是 4 位量化的最佳选择,因为基准测试可能保持平稳,而脆弱性却在增加。作者观察到 Pythia-160m 上存在这种模式,其中最终检查点遭受的质量损害大约是同等质量早期检查点的四倍。

该工具作为单命令 CLI 提供,适用于任何 Hugging Face 检查点套件,允许用户探测这些问题。作者指出,虽然这是一个可测量的范围而非普遍规律,但它与平均深度更新的秩压缩相关。

鼓励用户在各自的中间检查点上运行该工具并报告结果,包括负面发现,以帮助在不同模型家族中验证这一观察结果。