AI Model Radar mempublikasikan metodologi untuk menghitung apakah 46 model open-weights yang dilacak muat pada perangkat keras tertentu, menolak aturan folklore umum yang bisa meleset hingga faktor empat atau empat puluh. Situs ini menentukan kecocokan dengan menjumlahkan ukuran bobot GGUF yang terukur, aritmetika cache konteks dari file konfigurasi, dan overhead runtime, sambil memperhitungkan mekanisme perhatian hibrida seperti jendela geser dan perhatian laten multi-head.

  • Bobot diambil dari ukuran byte yang dipublikasikan daripada jumlah parameter untuk menghindari kesalahan pemecahan shard.
  • Cache konteks dihitung menggunakan jenis lapisan (penuh vs. jendela geser) dan dimensi kepala yang secara eksplisit dinyatakan dalam config.json.
  • Margin keamanan 12% dipertahankan untuk GPU standar, sementara Apple Silicon menggunakan 70% dari memori terunifikasi karena kendala macOS.
  • Untuk RTX 3060 12 GB, analisis menunjukkan 14 model muat pada konteks 8K dan 10 pada konteks 32K; Qwen3 14B memerlukan offloading bahkan pada konteks 8K.

Para penulis menolak untuk mempublikasikan skor kecepatan atau kualitas, berfokus semata-mata pada data kecocokan memori yang dapat direproduksi untuk membantu pengguna menentukan kompatibilitas perangkat keras tanpa menebak-nebak.