Mistral 发布了 Mistral Large 2,这是一款专为高吞吐单节点推理设计的新款大语言模型,拥有 1230 亿个参数。该模型支持 128k 上下文窗口和数十种语言,同时在编码、推理和指令遵循方面提供增强的性能。
- 预训练版本在 MMLU 上达到 84.0% 的准确率,为开源模型的性能/成本帕累托前沿树立了新标杆。
- 在编码和推理任务中,其表现与 GPT-4o、Claude 3 Opus 和 Llama 3 405B 等领先模型相当。
- 该模型经过训练以最小化幻觉,并在缺乏足够信息时承认无法给出自信的回答。
- 权重在 Mistral Research License 下提供,用于研究和非商业用途;商业自部署需要单独的许可证。
此次发布旨在为构建创新 AI 应用提供高性价比的替代方案,可在 la Plateforme、HuggingFace 以及包括 Google Cloud Platform、Azure、Amazon Bedrock 和 IBM watsonx.ai 在内的主要云提供商上获取。