IBM发布了Granite 4.2,这是一个包含3B、8B和30B规模的密集解码器推理大型语言模型系列。这些模型从零开始使用约15万亿个token进行预训练,上下文窗口扩展至512K token。

  • 训练流程包括在思维链和代理轨迹数据上的监督微调,随后是多阶段强化学习。
  • 8B和30B模型经过代理强化学习,以在实际沙盒环境中学习工具使用,包括软件工程和网页搜索。
  • 所有模型均通过OpenAI兼容端点支持原生工具调用,并包含思考或非思考模式的切换开关。
  • 这些模型在Apache 2.0许可证下发布。