Sberbank的AI Sage发布了GigaChat-3.5 Reasoning,这是一个432B-A28B混合专家(MoE)模型,利用Gated DeltaNet实现长上下文效率。

该模型通过CISPO使用代码、数学和通用任务领域的专家进行训练,然后通过on-policy蒸馏整合为单一模型。在评估中,其表现接近DeepSeek V4 Flash Preview,但在推理轨迹中使用少37%的token。

权重以MIT许可证在Hugging Face上提供,该模型可在giga.chat进行测试。