Исследователи из LMSYS опубликовали таблицу лидеров, использующую систему рейтинга Elo для сравнения больших языковых моделей, и выяснили, что модель Anthropic Claude 3 Opus заняла первое место. Модель получила рейтинг Elo 1253 на основе парных боев, оцененных человеческими голосующими.
- Claude 3 Opus удерживает наивысший рейтинг с 33 250 общими голосами и результатом +5/-5.
- Предварительные модели GPT-4 от OpenAI следуют вплотную с рейтингами 1251 и 1248.
- Google Bard (Gemini Pro) занимает четвертое место с рейтингом Elo 1203.
- Более старая модель GPT-4–0314 заняла шестое место с рейтингом 1185.
Этот бенчмарк предоставляет объективный метод отслеживания быстрых достижений в области языкового ИИ и выявления ведущих архитектур по мере обострения конкуренции среди крупных технологических компаний.