PASQA: модель оценки качества речи с фокусом на интонационных акцентах

PASQA — это модель оценки качества речи, предназначенная для оценки правильности интонационных акцентов в синтезированной японской речи. Она использует набор данных с контролируемыми ошибками акцентов и включает в себя саморегулирующее обучение, синтез с учетом моры, потери ранжирования и локализацию ошибок акцентов, чтобы обеспечить высокую точность обнаружения ошибок акцентов у разных говорящих, превосходя традиционные модели по согласованию с человеческими оценками.