研究人员引入了Sentence Translation Alignment Rate (STAR),这是一种辅助指标,旨在量化文档到文档机器翻译中句子级的结构保真度,解决遗漏和幻觉等问题。他们提出了STAR-masked Preference Optimization (StarPO),这是一个根据结构质量对假设进行排序的框架,并使用动态对齐掩码将优化集中在未对齐的片段上。
- STAR明确测量结构保真度,以解决源语言与目标语言对应关系的违规问题。
- StarPO利用动态对齐掩码在训练期间优化特定的未对齐片段。
- 在新闻和文学领域的实验表明,翻译质量和完整性有显著提升。
- 使用StarPO的紧凑模型在保持更高令牌效率的同时,性能超越了GPT-4o等庞大的专有系统。
该框架使较小的模型能够超越大型专有系统,同时保持更好的令牌效率。