NVIDIA已发布Nemotron-4 340B模型家族,包含Base、Instruct和Reward变体,采用宽松的开源许可证。这些模型设计为可在配备8块GPU的DGX H100上以FP8精度运行,并在9万亿个token上进行训练。
- Nemotron-4-340B-Instruct在指令遵循和聊天能力方面超越同类指令模型。
- Nemotron-4-340B-Reward在RewardBench上取得最高准确率,优于GPT-4o-0513和Gemini 1.5 Pro-0514等专有模型。
- 用于模型对齐的数据中超过98%为合成生成。
- NVIDIA开源了合成数据生成流水线,包括提示词和质量过滤工具。
此次发布旨在通过提供高质量的模型和用于生成合成训练数据的工具,支持社区研究和商业应用。