Researchers introduce Sentence Translation Alignment Rate (STAR), an auxiliary metric designed to quantify sentence-level structural fidelity in document-to-document machine translation, addressing issues like omissions and hallucinations. They propose STAR-masked Preference Optimization (StarPO), a framework that ranks hypotheses by structural quality and uses a dynamic alignment mask to focus optimization on misaligned segments.
- STAR explicitly measures structural fidelity to address source-target correspondence violations.
- StarPO utilizes a dynamic alignment mask to optimize specific misaligned segments during training.
- Experiments across news and literary domains show significant enhancements in translation quality and integrity.
- Compact models using StarPO surpass the performance of massive proprietary systems like GPT-4o with superior token efficiency.
The framework allows smaller models to outperform large proprietary systems while maintaining better token efficiency.