O Thinking Machines Lab lançou o Inkling-Small, um modelo Mixture-of-Experts de pesos abertos com 276 bilhões de parâmetros totais e 12 bilhões de parâmetros ativos. O modelo é treinado para raciocinar nativamente sobre texto, imagens e áudio, apresentando uma janela de contexto de 1M tokens e esforço de pensamento ajustável.

  • Os pesos estão disponíveis sob a licença Apache 2.0 no Hugging Face, com BF16 exigindo 600 GB de VRAM e a quantização NVFP4 reduzindo o requisito para 180 GB.
  • A arquitetura utiliza 42 camadas de decodificador, onde cada token é roteado para 6 dos 256 especialistas mais 2 especialistas compartilhados, processando imagens por meio de patches e áudio como espectrogramas dMel.
  • O Inkling-Small supera seu modelo professor maior, o Inkling, em benchmarks de raciocínio como Humanity's Last Exam (31,6% contra 29,7%) e SWE-bench Verified (80,2% contra 77,6%).
  • A recuperação factual recuou significativamente, com o SimpleQA Verified caindo para 20,6% a partir dos 43,9% do Inkling, enquanto as pontuações multimodais permaneceram próximas às do modelo maior.

O lançamento permite que startups e empresas hospedem internamente um modelo de ponta em configurações de GPU única ou dupla, suportando cargas de trabalho como agentes de codificação, automação de terminal e análise de call-center.