Thinking Machines Lab выпустила Inkling-Small, модель Mixture-of-Experts с открытыми весами, имеющую 276 миллиардов общих параметров и 12 миллиардов активных параметров. Модель обучена нативному рассуждению над текстом, изображениями и аудио, обладает контекстным окном на 1M токенов и регулируемым усилием размышления.
- Веса доступны по лицензии Apache 2.0 на Hugging Face; для BF16 требуется 600 GB VRAM, а квантование NVFP4 снижает требование до 180 GB.
- Архитектура использует 42 декодирующих слоя, где каждый токен маршрутизируется к 6 из 256 экспертов плюс 2 общих эксперта; изображения обрабатываются через патчи, а аудио — как dMel спектрограммы.
- Inkling-Small превосходит свою более крупную модель-учитель Inkling на бенчмарках рассуждения, таких как Humanity's Last Exam (31.6% против 29.7%) и SWE-bench Verified (80.2% против 77.6%).
- Фактическая память значительно ухудшилась: SimpleQA Verified упала до 20.6% по сравнению с 43.9% у Inkling, в то время как мультимодальные оценки остались близкими к более крупной модели.
Выпуск позволяет стартапам и предприятиям самостоятельно размещать модель уровня frontier на конфигурациях с одной или двумя GPU, поддерживая такие нагрузки, как кодовые агенты, автоматизация терминала и аналитика колл-центров.