腾讯已开源AngelSpec,这是一个基于torch原生的训练框架,支持自回归多令牌预测(MTP)以及针对Hy3模型的块并行DFlash系列草稿生成器。该系统将工作负载异构性视为主要设计约束,使其能够根据特定用例专门化结构、训练数据和验证深度。
- AngelSpec通过使用共享参数、多深度的方案解决MTP中的训练-推理不匹配问题,其中物理块在训练期间以自回归方式展开。
- 该框架采用目标模型回滚和冻结骨干参数,以确保草稿生成器在不改变验证分布的情况下近似服务时的令牌选择。
- DFly块扩散架构引入了混合目标条件和前驱条件自回归头,以提高代码和数学领域的接受率。
- 在Qwen3-8B上,DFly实现了5.41的平均接受长度均值,优于DSpark(5.32)、DFlash(4.57)和MTP(3.24)。
- 在Hy3-A21B上,DFLY达到4.79的平均接受长度,相较于DFlash提升29.8%,相较于MTP提升59.7%。
- 该框架支持长达128k令牌长上下文训练,并包含用于目标、目标和优化器(如Muon)的可插拔接口。
AngelSpec为六种草稿架构的训练提供了统一管道,在保持跨多样化基准测试的高接受率的同时,显著提升了实时流量吞吐量。