Thinking Machines Lab ha lanzado Inkling-Small, un modelo Mixture-of-Experts de pesos abiertos con 276 mil millones de parámetros totales y 12 mil millones de parámetros activos. El modelo está entrenado para razonar nativamente sobre texto, imágenes y audio, cuenta con una ventana de contexto de 1M tokens y esfuerzo de pensamiento ajustable.

  • Los pesos están disponibles bajo Apache 2.0 en Hugging Face, requiriendo BF16 600 GB de VRAM y la cuantización NVFP4 reduce el requisito a 180 GB.
  • La arquitectura utiliza 42 capas de decodificador donde cada token se enruta a 6 de 256 expertos más 2 expertos compartidos, procesando imágenes mediante parches y audio como espectrogramas dMel.
  • Inkling-Small supera a su modelo maestro más grande Inkling en benchmarks de razonamiento como Humanity's Last Exam (31.6% vs 29.7%) y SWE-bench Verified (80.2% vs 77.6%).
  • El recuerdo factual retrocedió significativamente, con SimpleQA Verified cayendo a 20.6% desde el 43.9% de Inkling, mientras que las puntuaciones multimodales se mantuvieron cerca del modelo más grande.

El lanzamiento permite a startups y empresas autoalojar un modelo de vanguardia en configuraciones de GPU única o dual, admitiendo cargas de trabajo como agentes de codificación, automatización de terminal y análisis de centros de llamadas.