MiniMax는 세계 최초의 오픈 가중치 대규모 하이브리드 어텐션 추론 모델인 MiniMax-M1을 출시했습니다. 이전 MiniMax-Text-01 아키텍처를 기반으로 구축된 이 모델은 Mixture-of-Experts (MoE) 설계와 번개 같은 어텐션 메커니즘을 결합하여 100만 토큰 컨텍스트 지원과 효율적인 테스트 타임 컴퓨팅 스케일링을 가능하게 합니다.

이 모델은 총 4560억 개의 파라미터를 가지며, 토큰당 459억 개가 활성화됩니다. 100K 생성 길이에서 DeepSeek R1의 FLOPs의 25%만 소비합니다. 대규모 강화 학습과 40K 및 80K 사고 예산을 가진 두 가지 새로운 버전으로 훈련되었습니다. 실험 결과, 이 모델은 복잡한 소프트웨어 엔지니어링, 도구 사용 및 긴 컨텍스트 작업에서 DeepSeek-R1 및 Qwen3-235B 같은 모델들을 능가하는 것으로 나타났습니다.

MiniMax-M1은 긴 입력과 광범위한 사고 과정에 걸쳐 효율적인 추론을 가능하게 함으로써 차세대 언어 모델 에이전트의 기반 역할을 합니다.