著者は、言語モデルの証拠飽和点(k*)を測定するために、Hugging Face上でパイロット論文とオープンレジストリを公開しました。この指標は、プロンプトに注入する最適な証拠フラグメント数を決定します。より多くのコンテキストを追加しても正しさが単調に向上するわけではなく、コストや認識論的汚染を増加させる可能性があるためです。

  • 研究では、タスクの種類に応じて正しさ最適のkが1から完全な証拠セットまで範囲を持つことがわかり、単一のコンテキストプロファイルでは不十分であることが示唆されています。
  • Hugging Face上にオープンEvidence-k Registryが作成され、論文からの35件のタスクレベル測定で初期化されました。
  • レジストリは、ローカルモデルの運用者に対し、モデル改訂、量子化、提供バックエンド、信頼性指標を文書化することで貢献することを呼びかけています。

このイニシアチブは、正しさと効率のバランスを取るために、モデルおよびバックエンドごとにコンテキストウィンドウをキャリブレーションするための再現可能なプロトコルを提供することを目指しています。