Сотрудник OpenAI Уильям Феду подтвердил, что загадочный чатбот "gpt-chatbot", появившийся в лидерборде Chatbot Arena, является предварительной версией недавно запущенной модели GPT-4o. Во время этих тайных тестов модель показала наивысший когда-либо зафиксированный результат на платформе.

  • OpenAI начала тестировать несколько версий GPT-4o в арене с апреля, используя псевдонимы вроде "gpt2-chatbot" и "im-also-a-good-gpt2-chatbot".
  • После релиза GPT-4o значительно опередила предыдущие топовые модели Claude 3 Opus и GPT-4 Turbo на примерно 50 очков Эло.
  • На момент подготовки материала тестовая модель имела рейтинг Эло 1309, в то время как у GPT-4-Turbo-2023-04-09 он составлял 1253, а у Claude 3 Opus — 1246.

Официальный аккаунт LMSYS отметил, что публичная версия GPT-4o уже вошла в арену и вскоре появится в открытом лидерборде.