Arsitektur PIN v2 memperkenalkan metode untuk pra-memilih ukuran jaringan saraf dan kecepatan inferensi sebelum pelatihan dengan menggunakan pengikatan bobot. Teknik ini memaksa kelompok sel untuk menyimpan nilai yang identik, memungkinkan jaringan mempertahankan lebarnya sambil secara drastis mengurangi jumlah bobot yang disimpan.
- Pengikatan memisahkan lebar jaringan dari biaya penyimpanan; model dengan 256 unit dapat mu dalam anggaran 3.000 angka yang biasanya hanya mengizinkan satu unit tersembunyi.
- Dalam pengujian terhadap pemangkasan magnitudo, faktorisasi rank-rendah, kuantisasi, dan distilasi, pengikatan menang di empat dari lima anggaran bit dan menjadi satu-satunya metode yang berfungsi di bawah 100 KB.
- Pada kompresi 128x, model terikat berkinerja dalam selisih 1,2 poin dari versi tanpa kompresi.
- Pendekatan ini memungkinkan sistem koordinat bersama antar model, memungkinkan jaringan dasar dan peta linear untuk memprediksi varian untuk kombinasi tugas yang belum pernah dilihat tanpa pelatihan ulang.
- Total 43.000 angka (dasar ditambah peta) dapat menghasilkan salah satu dari 120 tugas yang mungkin, sedangkan penyimpanan konvensional memerlukan 14 juta angka.
Kerangka kerja ini memungkinkan pengembang menentukan anggaran penyimpanan dan batas inferensi terlebih dahulu, membiarkan arsitektur model mengikuti batasan tersebut daripada melakukan penyetelan hingga ditemukan kecocokan.