L'auteur a publié un article pilote et un registre ouvert sur Hugging Face pour mesurer le point de saturation des preuves (k*) des modèles de langage. Cette métrique détermine le nombre optimal de fragments de preuves à injecter dans les prompts, car ajouter plus de contexte n'améliore pas de manière monotone la correction et peut augmenter le coût ou la contamination épistémique.
- L'étude trouve que le k optimal pour la correction varie de 1 jusqu'à l'ensemble complet des preuves selon le type de tâche, suggérant qu'un profil de contexte unique est insuffisant.
- Un Evidence-k Registry ouvert a été créé sur Hugging Face, ensemencé avec 35 mesures au niveau de la tâche issues de l'article.
- Le registre invite les opérateurs de modèles locaux à contribuer en documentant les révisions de modèles, les quantifications, les backends servis et les métriques de fiabilité.
Cette initiative vise à fournir un protocole reproductible pour calibrer les fenêtres de contexte par modèle et backend afin d'équilibrer la correction avec l'efficacité.