Mistral은 높은 처리량의 단일 노드 추론을 위해 설계된 1230억 개의 파라미터를 갖춘 새로운 대규모 언어 모델인 Mistral Large 2를 출시했습니다. 이 모델은 128k 컨텍스트 윈도우와 수십 가지 언어를 지원하며, 코딩, 추론 및 지시 따르기에서 향상된 성능을 제공합니다.

  • 사전 학습 버전은 MMLU에서 84.0%의 정확도를 달성하여 오픈 모델의 성능/비용 파레토 최적 곡면에서 새로운 기준점을 설정했습니다.
  • 코드 및 추론 작업에서 GPT-4o, Claude 3 Opus, Llama 3 405B와 같은 선도적인 모델들과 동등한 성능을 발휘합니다.
  • 이 모델은 환각 현상을 최소화하고 충분한 정보가 없을 때 자신감 있는 답변을 제공하지 않도록 훈련되었습니다.
  • 가중치는 연구 및 비상업적 용도를 위해 Mistral Research License 하에 사용 가능하며, 상업적 자체 배포에는 별도의 라이선스가 필요합니다.

이번 출시는 Google Cloud Platform, Azure, Amazon Bedrock, IBM watsonx.ai를 포함한 주요 클라우드 공급자, la Plateforme, HuggingFace에서 이용 가능하여 혁신적인 AI 애플리케이션 구축을 위한 비용 효율적인 대안을 제공하는 것을 목표로 합니다.