本文介绍了一种方法,将来自200多个内部应用程序的流量整合到一个自托管的大型语言模型上,以解决数据驻留约束和GPU碎片化问题。该方法通过在每个轴上训练单独的GRPO专家并使用两阶段SLERP合并它们,来弥补指令遵循、函数调用和内部任务分配方面的质量差距。
- 使用分层到生产流量的离线基准跟踪质量,并由确定性验证器或校准的LLM裁判进行评分。
- 单独的GRPO专家解决特定的失败模式:语义崩溃、过度调用和冗长黑客行为。
- 结果模型在内部基准测试中超越了基线模型,后者总参数量大约是其7倍。
- 具体改进包括Arena得分为69.6对比65.8,指令遵循为0.85对比0.83,函数调用为0.79对比0.77。
整合后的模型吸收了平台50%的流量,每月处理1.16亿次请求,而服务成本仅为原来的几分之一。