Thinking Machines Lab telah merilis Inkling-Small, sebuah model Mixture-of-Experts dengan bobot terbuka yang memiliki total 276 miliar parameter dan 12 miliar parameter aktif. Model ini dilatih untuk bernalar secara native pada teks, gambar, dan audio, serta dilengkapi jendela konteks 1M token dan upaya berpikir yang dapat disesuaikan.

  • Bobot tersedia di bawah lisensi Apache 2.0 di Hugging Face, dengan BF16 membutuhkan 600 GB VRAM dan kuantisasi NVFP4 menurunkan kebutuhan menjadi 180 GB.
  • Arsitektur menggunakan 42 lapisan decoder di mana setiap token dialihkan ke 6 dari 256 ahli ditambah 2 ahli bersama, memproses gambar melalui patch dan audio sebagai spektrogram dMel.
  • Inkling-Small melampaui model guru yang lebih besar, yaitu Inkling, pada benchmark penalaran seperti Humanity's Last Exam (31.6% vs 29.7%) dan SWE-bench Verified (80.2% vs 77.6%).
  • Pengingatan fakta mengalami penurunan signifikan, dengan SimpleQA Verified turun menjadi 20.6% dari 43.9% Inkling, sementara skor multimodal tetap dekat dengan model yang lebih besar.

Rilis ini memungkinkan startup dan perusahaan untuk meng-host mandiri model berkapabilitas frontier pada setup GPU tunggal atau ganda, mendukung beban kerja seperti agen pemrograman, otomatisasi terminal, dan analitik pusat panggilan.