Mistral a publié Mistral Large 2, un nouveau grand modèle de langage comportant 123 milliards de paramètres conçu pour l'inférence mono-nœud à haut débit. Le modèle prend en charge une fenêtre de contexte de 128k et des dizaines de langues tout en offrant des performances améliorées en codage, raisonnement et suivi d'instructions.
- La version pré-entraînée atteint 84,0 % de précision sur MMLU, établissant un nouveau point sur la frontière de Pareto performance/coût pour les modèles ouverts.
- Il obtient des performances comparables aux meilleurs modèles tels que GPT-4o, Claude 3 Opus et Llama 3 405B dans les tâches de codage et de raisonnement.
- Le modèle est entraîné pour minimiser les hallucinations et reconnaître lorsqu'il manque d'informations suffisantes pour fournir des réponses fiables.
- Les poids sont disponibles sous la Mistral Research License pour la recherche et un usage non commercial, l'autodéploiement commercial nécessitant une licence distincte.
Cette publication vise à offrir une alternative rentable pour construire des applications IA innovantes, avec disponibilité sur la Plateforme, HuggingFace et les principaux fournisseurs cloud incluant Google Cloud Platform, Azure, Amazon Bedrock et IBM watsonx.ai.