Исследователи из LMSYS опубликовали таблицу лидеров, использующую систему рейтинга Elo для сравнения больших языковых моделей, и выяснили, что модель Anthropic Claude 3 Opus заняла первое место. Модель получила рейтинг Elo 1253 на основе парных боев, оцененных человеческими голосующими.

  • Claude 3 Opus удерживает наивысший рейтинг с 33 250 общими голосами и результатом +5/-5.
  • Предварительные модели GPT-4 от OpenAI следуют вплотную с рейтингами 1251 и 1248.
  • Google Bard (Gemini Pro) занимает четвертое место с рейтингом Elo 1203.
  • Более старая модель GPT-4–0314 заняла шестое место с рейтингом 1185.

Этот бенчмарк предоставляет объективный метод отслеживания быстрых достижений в области языкового ИИ и выявления ведущих архитектур по мере обострения конкуренции среди крупных технологических компаний.