PIN Architecture v2は、重みの共有を用いて、トレーニング前にニューラルネットワークのサイズと推論速度を事前に選択する方法を導入します。この手法は、セルのグループに同一の値を持たせることで、ネットワークの幅を維持しつつ、保存される重みの数を大幅に削減します。
- 重みの共有によりネットワーク幅とストレージコストが分離され、256ユニットのモデルが、通常は1つの隠れユニットしか許容しない3,000数の予算内に収まる。
- magnitude pruning、低ランク分解、量子化、ディステイラレーションとのテストにおいて、重みの共有は5つのビット予算のうち4つで勝利し、100 KB未満でも機能する唯一の手法だった。
- 128倍圧縮において、共有されたモデルは非圧縮版と1.2ポイント以内のパフォーマンスを示す。
- このアプローチにより、モデル間で共有座標系が可能になり、ベースネットワークと線形写像によって再トレーニングなしで未見のタスク組み合わせに対するバリアントを予測できる。
- 合計43,000数(ベース+マップ)で120の可能なタスクのいずれかを出力できるのに対し、従来のストレージでは14百万数が必要だった。
このフレームワークにより、開発者はまずストレージ予算と推論の制約を指定でき、モデルアーキテクチャが適合するまで調整するのではなく、これらの制約に従うことができる。