llama.cpp 프로젝트는 버전 b10437을 출시하여 MiniMax-Text-01 및 MiniMax-M1 인과 언어 모델에 대한 네이티브 지원을 도입했습니다. 이 업데이트에는 llama.cpp 프레임워크 내에서 이러한 특정 모델을 실행하는 데 필요한 변환 스크립트, 채팅 템플릿 및 모델 아키텍처 구현이 포함되어 있습니다.

  • 모델 레이어에 `MiniMaxText01ForCausalLM` 및 `MiniMaxM1ForCausalLM` 지원을 추가했습니다.
  • 샘플링 프로세스의 방해를 방지하기 위해 제로 값 임베딩에 대한 토큰 억제를 구현했습니다.
  • 상태 전치 연산을 제거하고 간결한 구현을 위해 공통 함수를 사용하여 성능을 최적화했습니다.
  • MiniMax-M1 전용 Jinja 채팅 템플릿을 추가했습니다.
  • CPU, GPU 및 다양한 가속기를 위한 macOS, Linux, Windows, Android 및 openEuler에 대한 빌드 아티팩트를 포함했습니다.

이 릴리스를 통해 사용자는 llama.cpp의 기존 추론 인프라를 사용하여 MiniMax 모델을 로컬에서 실행할 수 있습니다.