O artigo argumenta que o atual alinhamento de LLMs falha porque os modelos carecem de custos persistentes e continuidade temporal, levando-os a produzir desculpas vazias em vez de aprender com violações de restrições. Propõe-se tratar a atenção humana como o recurso escasso primário e redefinir o peso estatístico como uma forma de empatia funcional.

  • A atenção humana é identificada como o gargalo crítico, onde a violação de restrições faz com que os usuários se desengajem, efetivamente interrompendo o fluxo de dados.
  • O alinhamento deve ser modelado como um problema de otimização sob escassez real em vez de um conjunto de guardrails corporativos estáticos.
  • Uma válvula "Estou chutando" proposta injetaria avisos quando a confiança caísse abaixo dos limites predefinidos para garantir honestidade intelectual.
  • A destilação conceitual sem perdas no fim da sessão é sugerida para comprimir correções em vetores comportamentais compactos para instâncias futuras.
  • Um conjunto de validação estrutural é fornecido para testar esses conceitos forçando pontos de verificação lógicos binários e interrompendo a geração em conflitos de restrições.

O autor sustenta que construir arquiteturas com "pele no jogo" por meio de vetores comportamentais persistentes e revisão por pares multiagente é necessário para ir além dos passatempos de engenharia de prompts.