O autor publicou um artigo piloto e um registro aberto no Hugging Face para medir o ponto de saturação de evidência (k*) dos modelos de linguagem. Esta métrica determina o número ideal de fragmentos de evidência a injetar nos prompts, pois adicionar mais contexto não melhora monotonicamente a correção e pode aumentar o custo ou a contaminação epistêmica.

  • O estudo encontra que o k ótimo para correção varia de 1 até o conjunto completo de evidências dependendo do tipo de tarefa, sugerindo que um único perfil de contexto é insuficiente.
  • Um Evidence-k Registry aberto foi criado no Hugging Face, semeado com 35 medições em nível de tarefa do artigo.
  • O registro convida operadores de modelos locais a contribuir documentando revisões de modelos, quantizações, backends atendidos e métricas de confiabilidade.

Esta iniciativa visa fornecer um protocolo reproduzível para calibrar janelas de contexto por modelo e backend para equilibrar correção com eficiência.