La Arquitectura PIN v2 introduce un método para pre-seleccionar el tamaño y la velocidad de inferencia de una red neuronal antes del entrenamiento mediante la vinculación de pesos. Esta técnica obliga a grupos de celdas a mantener valores idénticos, permitiendo que la red mantenga su ancho mientras reduce drásticamente el número de pesos almacenados.

  • La vinculación desacopla el ancho de la red del costo de almacenamiento; un modelo con 256 unidades puede caber dentro de un presupuesto de 3.000 números que normalmente solo permitiría una unidad oculta.
  • En pruebas frente a la poda por magnitud, la factorización de bajo rango, la cuantización y la destilación, la vinculación ganó cuatro de cinco presupuestos de bits y fue el único método funcional por debajo de 100 KB.
  • A una compresión de 128x, el modelo vinculado se desempeña dentro de 1.2 puntos de la versión sin comprimir.
  • El enfoque permite un sistema de coordenadas compartido entre modelos, permitiendo que una red base y un mapa lineal predigan variantes para combinaciones de tareas no vistas sin reentrenamiento.
  • Un total de 43.000 números (base más mapa) pueden emitir cualquiera de las 120 tareas posibles, mientras que el almacenamiento convencional requeriría 14 millones de números.

Este marco permite a los desarrolladores especificar primero los presupuestos de almacenamiento y los límites de inferencia, permitiendo que la arquitectura del modelo siga esas restricciones en lugar de ajustar hasta encontrar un ajuste.