Une évaluation sur 600 cas du jeu de données MuSiQue utilisant les modèles gelés Qwen2.5-7B-Instruct et MiniLM teste si la sélection de contexte consciente des ponts peut surpasser le contexte complet et d'autres références.

  • La promotion sémantique des ponts a atteint un F1 de 0,3482, surpassant BM25 (0,3113) et le noyau sémantique avec promotion aléatoire (0,3310).
  • L'approche a utilisé 16,6 % moins de tokens d'entrée que le contexte complet tout en réduisant le temps de préremplissage de 15,3 % et la latence de 9,6 %.
  • Les comparaisons appariées par bootstrap montrent des gains F1 statistiquement significatifs par rapport à BM25 (+0,0368) et aux contrôles aléatoires (+0,0172).
  • La différence entre la promotion des ponts et le contexte complet n'était pas concluante, avec un delta de F1 de +0,0101.

Les résultats suggèrent que la promotion consciente des ponts préserve plus fiablement les preuves porteuses de dépendance qu'un raccourcissement générique ou une sélection lexicale.