作者已在 Hugging Face 上发布了一篇试点论文和一个开放注册表,用于测量语言模型的证据饱和点 (k*)。该指标确定了注入提示中的最佳证据片段数量,因为增加更多上下文并不会单调地提高正确性,反而可能增加成本或认知污染。
- 研究发现,针对正确性的最优 k 值范围从 1 到完整证据集不等,具体取决于任务类型,这表明单一上下文配置文件是不足的。
- 已在 Hugging Face 上创建了开放 Evidence-k Registry,并填充了论文中的 35 个任务级测量数据。
- 该注册表邀请本地模型运营商贡献数据,记录模型修订、量化、服务后端和可靠性指标。
该倡议旨在提供一种可重复的协议,用于根据每个模型和后端校准上下文窗口,以平衡正确性与效率。