Thinking Machines Lab은 총 2760억 개의 파라미터와 120억 개의 활성 파라미터를 가진 오픈 가중치 Mixture-of-Experts 모델인 Inkling-Small을 출시했습니다. 이 모델은 텍스트, 이미지, 오디오에 대해 네이티브 추론을 수행하도록 훈련되었으며, 1M 토큰 컨텍스트 윈도우와 조정 가능한 사고 노력을 특징으로 합니다.

  • 가중치는 Hugging Face에서 Apache 2.0 라이선스로 제공되며, BF16은 600 GB VRAM이 필요하고 NVFP4 양자화는 요구 사항을 180 GB로 줄입니다.
  • 아키텍처는 각 토큰이 256개 전문가 중 6개와 2개의 공유 전문가에게 라우팅되는 42개의 디코더 레이어를 사용하며, 이미지는 패치를 통해, 오디오는 dMel 스펙트로그램으로 처리됩니다.
  • Inkling-Small은 Humanity's Last Exam(31.6% 대 29.7%) 및 SWE-bench Verified(80.2% 대 77.6%)와 같은 추론 벤치마크에서 더 큰 교사 모델인 Inkling을 능가합니다.
  • 사실적 회상이 현저히 저하되어 SimpleQA Verified가 Inkling의 43.9%에서 20.6%로 떨어졌으며, 멀티모달 점수는 더 큰 모델과 근접하게 유지되었습니다.

이 출시로 스타트업과 기업은 단일 또는 듀얼 GPU 설정에서 프론티어 수준의 모델을 자체 호스팅할 수 있게 되었으며, 코딩 에이전트, 터미널 자동화, 콜센터 분석 등의 워크로드를 지원합니다.