PIN 아키텍처 v2는 가중치 묶음을 사용하여 훈련 전에 신경망의 크기와 추론 속도를 사전에 선택하는 방법을 소개합니다. 이 기법은 셀 그룹이 동일한 값을 보유하도록 강제하여 네트워크가 너비를 유지하면서 저장된 가중치의 수를 극적으로 줄입니다.
- 묶음은 네트워크 너비를 저장 비용과 분리하며, 256개의 유닛을 가진 모델은 일반적으로 하나의 숨겨진 유닛만 허용할 3,000개 숫자 예산 내에 맞출 수 있습니다.
- 크기 가지치기, 저랭크 분해, 양자화 및 증류에 대한 테스트에서 묶음은 다섯 가지 비트 예산 중 네 가지를 승리했으며, 100 KB 미만에서도 작동하는 유일한 방법이었습니다.
- 128x 압축 시 묶인 모델은 비압축 버전과 1.2 포인트 이내의 성능을 보입니다.
- 이 접근 방식은 모델 간 공유 좌표계를 가능하게 하여, 재학습 없이 기본 네트워크와 선형 매핑이 보이지 않는 작업 조합에 대한 변형을 예측할 수 있습니다.
- 총 43,000개의 숫자(기본값 plus 매핑)가 120가지 가능한 작업 중 어느 것이든 생성할 수 있는 반면, 기존 저장 방식은 1천 4백만 개의 숫자가 필요합니다.
이 프레임워크는 개발자가 먼저 저장 예산과 추론 한계를 지정할 수 있게 하여, 모델 아키텍처가 적합함을 찾을 때까지 튜닝하는 대신 해당 제약 사항을 따르도록 합니다.