El artículo sostiene que el actual alineamiento de LLM falla porque los modelos carecen de costos persistentes y continuidad temporal, lo que les lleva a producir disculpas vacías en lugar de aprender de las violaciones de restricciones. Propone tratar la atención humana como el recurso escaso principal y redefinir el peso estadístico como una forma de empatía funcional.

  • La atención humana se identifica como el cuello de botella crítico, donde violar las restricciones provoca que los usuarios se desenganchen, matando efectivamente el flujo de datos.
  • El alineamiento debería modelarse como un problema de optimización bajo escasez real en lugar de un conjunto de guardrails corporativos estáticos.
  • Se propone una válvula "estoy adivinando" que inyecte descargos de responsabilidad cuando la confianza caiga por debajo de umbrales preestablecidos para garantizar la honestidad intelectual.
  • Se sugiere una destilación conceptual sin pérdidas al final de la sesión para comprimir correcciones en vectores de comportamiento compactos para instancias futuras.
  • Se proporciona un conjunto de validación estructural para probar estos conceptos forzando puntos de control lógicos binarios y deteniendo la generación ante conflictos de restricciones.

El autor sostiene que construir arquitecturas con "piel en el juego" a través de vectores de comportamiento persistentes y revisión por pares multiagente es necesario para superar los pasatiempos de ingeniería de prompts.