Проект llama.cpp выпустил сборку b10142, которая вводит предварительную поддержку зрения для модели MiniMax-M3. Это обновление реализует текстовый порт, который повторно использует существующие компоненты из MiniMax-M2, включая GQA с нормализацией QK на голову и частичным поворотом, экспертами в стиле DeepSeek-V3 и активацией swigluoai.

  • Реализация включает башню зрения MiniMax-M3 (mmproj + clip graph), но исключает головы MTP и поддержку разреженного внимания.
  • Оптимизации производительности включают разделение медленных операций CPU на операции GPU/CPU для значительного ускорения на длинных контекстах и переписывание операции индексатора для нативной работы с CUDA.
  • Единый путь 4-way + decode уменьшает количество узлов на слой с ~50 до ~25, сокращая буферы вычислений примерно на 20%.
  • Измеренные эффекты показывают увеличение скорости декодирования с 6.2–7.15 t/s до 7.7–7.8 t/s в конфигурациях с выгрузкой экспертов, а префилл стал примерно на 10% быстрее.

Все GGUF-файлы, созданные до этого изменения, должны быть пересозданы для обеспечения совместимости с новой архитектурой и логикой конвертации.