一位开发者正在寻求对 SpiralCoreAttention 的反馈,这是一个用于开放权重 LLM 微调的实验性训练时上下文选择原型。该系统在每次前向和反向传播过程中不处理完整的长序列,而是从序列中选择特定的 token 块进行训练,同时在保留的全上下文序列上评估生成的适配器。
在单个 RTX PRO 6000 Blackwell GPU 上使用 Qwen2.5-7B-Instruct 和 4-bit NF4 量化的内部 QLoRA 实验显示,平均训练步骤加速比为 1.675×,峰值 VRAM 减少了 6.036 GB。这些结果是在使用 8,192-token 序列、经过 48 个训练步骤且上下文选择配置为 60% 的情况下,通过三个随机种子观察到的。
作者强调,这些是本地语料库、短期、单 GPU 的研究结果,并非生产声明或更大规模完整预训练的证明。该帖子请求关于评估协议、适当任务级质量指标、既定基线以及验证前需测试的潜在故障模式的技术反馈。