A Arquitetura PIN v2 introduz um método para pré-selecionar o tamanho e a velocidade de inferência de uma rede neural antes do treinamento, utilizando amarração de pesos. Essa técnica força grupos de células a armazenar valores idênticos, permitindo que a rede mantenha sua largura enquanto reduz drasticamente o número de pesos armazenados.

  • A amarração desacopla a largura da rede do custo de armazenamento; um modelo com 256 unidades pode caber dentro de uma cota de 3.000 números que normalmente permitiria apenas uma unidade oculta.
  • Em testes comparados à poda por magnitude, fatoração de baixo posto, quantização e destilação, a amarração venceu quatro das cinco cotas de bits e foi o único método funcional abaixo de 100 KB.
  • Com compressão de 128x, o modelo amarrado tem desempenho dentro de 1,2 pontos da versão não comprimida.
  • A abordagem permite um sistema de coordenadas compartilhado entre modelos, possibilitando que uma rede base e um mapa linear prevejam variantes para combinações de tarefas não vistas sem retreinamento.
  • Um total de 43.000 números (base mais mapa) pode gerar qualquer uma das 120 tarefas possíveis, enquanto o armazenamento convencional exigiria 14 milhões de números.

Este framework permite que desenvolvedores especifiquem cotas de armazenamento e limites de inferência primeiro, permitindo que a arquitetura do modelo siga essas restrições em vez de ajustar até encontrar um ajuste adequado.