LLMs превосходят людей по предсказанию следующего говорящего

Большие языковые модели превосходили людей и модели супервизионного обучения при предсказании следующего говорящего с использованием корпуса AMI, несмотря на отсутствие аудиовизуальных данных и доменной подготовки. Мультимодальные LLMs превосходили текстовые LLMs по обнаружению адресата и изменениях в диалоге, но все еще не достигали уровня человеческой производительности, подчеркивая трудности в использовании исходных аудиовизуальных сигналов. Исследования с устранением компонентов показывают, что контекст диалога является критически важным, особенно для предсказания следующего говорящего, при этом как люди, так и LLMs испытывают трудности при частых изменениях ритма диалога.