연구자들은 문장 수준의 구조적 충실도를 정량화하기 위해 설계된 보조 지표인 Sentence Translation Alignment Rate (STAR)를 소개합니다. 이는 누락과 환각과 같은 문제를 해결합니다. 그들은 가설을 구조적 품질로 순위 매기고 동적 정렬 마스크를 사용하여 정렬되지 않은 세그먼트에 최적화를 집중하는 프레임워크인 STAR-masked Preference Optimization (StarPO)를 제안합니다.

  • STAR는 소스-대상 대응 위반을 해결하기 위해 구조적 충실도를 명시적으로 측정합니다.
  • StarPO는 훈련 중 특정 정렬되지 않은 세그먼트를 최적화하기 위해 동적 정렬 마스크를 활용합니다.
  • 뉴스 및 문학 도메인 전반의 실험은 번역 품질과 무결성의 상당한 개선을 보여줍니다.
  • StarPO를 사용하는 컴팩트 모델은 GPT-4o와 같은 거대한 독점 시스템보다 성능을 뛰어넘으며 우수한 토큰 효율성을 유지합니다.

이 프레임워크는 더 작은 모델이 더 나은 토큰 효율성을 유지하면서 큰 독점 시스템을 능가할 수 있게 합니다.