Автор опубликовал пилотную статью и открытый реестр на Hugging Face для измерения точки насыщения доказательствами (k*) языковых моделей. Этот метрика определяет оптимальное количество фрагментов доказательств, которые следует внедрять в промпты, поскольку добавление большего количества контекста не монотонно улучшает корректность и может увеличить стоимость или эпистемическое загрязнение.

  • Исследование показывает, что оптимальное для корректности k варьируется от 1 до полного набора доказательств в зависимости от типа задачи, что предполагает недостаточность единого профиля контекста.
  • На Hugging Face создан открытый Evidence-k Registry, заполненный 35 измерениями на уровне задач из статьи.
  • Реестр приглашает операторов локальных моделей внести вклад, документируя изменения моделей, квантования, обслуживающие бэкенды и метрики надежности.

Эта инициатива направлена на предоставление воспроизводимого протокола для калибровки окон контекста для каждой модели и бэкенда с целью баланса между корректностью и эффективностью.