El autor ha publicado un artículo piloto y un registro abierto en Hugging Face para medir el punto de saturación de evidencia (k*) de los modelos de lenguaje. Esta métrica determina el número óptimo de fragmentos de evidencia para inyectar en los prompts, ya que agregar más contexto no mejora monótonamente la corrección y puede aumentar el costo o la contaminación epistémica.
- El estudio encuentra que el k óptimo para la corrección varía de 1 hasta el conjunto completo de evidencia dependiendo del tipo de tarea, lo que sugiere que un único perfil de contexto es insuficiente.
- Se ha creado un Evidence-k Registry abierto en Hugging Face, sembrado con 35 mediciones a nivel de tarea del artículo.
- El registro invita a los operadores de modelos locales a contribuir documentando revisiones de modelos, cuantizaciones, backends atendidos y métricas de confiabilidad.
Esta iniciativa tiene como objetivo proporcionar un protocolo reproducible para calibrar las ventanas de contexto por modelo y backend para equilibrar la corrección con la eficiencia.