Levent Bulut a mis à jour la définition opérationnelle du « biais de résumé », passant d'une description vague à une construct testable, en établissant un protocole de recherche enregistré avec des falsificateurs prédéfinis. La nouvelle définition caractérise le biais comme la tendance systématique des modèles à remplacer la structure du mode montré par des étiquettes de résumé abstraites (mode dit), plutôt que de simplement supprimer les détails.

  • Le construct est défini comme le remplacement de la structure du mode montré reconstituable par l'étiquette de résumé abstraite qui nomme son contenu, favorisant spécifiquement les déclarations « dites » par rapport aux indices physiques « montrés ».
  • Le protocole nécessite 20 paires appariées de stimuli écrits par des humains et une évaluation par au moins trois familles de modèles utilisant des juges LLM.
  • Un falsificateur clé est établi : si les modèles ne montrent aucune préférence pour le mode dit par rapport aux humains (Cohen’s h ≥ 0,3 ou OR ≥ 2), le construct sera retiré.
  • Des vérifications discriminantes sont incluses pour s'assurer que le biais est dissocié de la verbosité et de la complaisance en relançant les tests avec des paires à longueur non appariée et un cadrage varié.

Bulut sollicite des critiques sur la conception, notamment concernant le fait si l'appariement de longueur sépare suffisamment ce biais du biais de verbosité et si l'Indice d'Information Supprimée est l'instrument correct pour mesurer la charge inférentielle.