Les chercheurs introduisent Sentence Translation Alignment Rate (STAR), une métrique auxiliaire conçue pour quantifier la fidélité structurelle au niveau de la phrase dans la traduction automatique document-à-document, abordant des problèmes tels que les omissions et les hallucinations. Ils proposent STAR-masked Preference Optimization (StarPO), un framework qui classe les hypothèses par qualité structurelle et utilise un masque d'alignement dynamique pour concentrer l'optimisation sur les segments désalignés.
- STAR mesure explicitement la fidélité structurelle pour traiter les violations de correspondance source-cible.
- StarPO utilise un masque d'alignement dynamique pour optimiser des segments spécifiques désalignés pendant l'entraînement.
- Les expériences dans les domaines des actualités et de la littérature montrent des améliorations significatives de la qualité et de l'intégrité de la traduction.
- Les modèles compacts utilisant StarPO surpassent les performances de systèmes propriétaires massifs comme GPT-4o avec une efficacité token supérieure.
Le framework permet aux modèles plus petits de surpasser les grands systèmes propriétaires tout en maintenant une meilleure efficacité token.