O funcionário da OpenAI William Fedus confirmou que o chatbot misterioso "gpt-chatbot" que aparece no ranking da Chatbot Arena é uma versão pré-lançamento do recém-lançado modelo GPT-4o. O modelo alcançou a maior pontuação já registrada na plataforma durante esses testes secretos.
- A OpenAI testou várias versões do GPT-4o na arena a partir de abril, usando aliases como "gpt2-chatbot" e "im-also-a-good-gpt2-chatbot".
- Após o lançamento, o GPT-4o superou os modelos topo anteriores Claude 3 Opus e GPT-4 Turbo por uma margem significativa de aproximadamente 50 pontos Elo.
- Até o fechamento desta matéria, o modelo de teste mantinha uma pontuação Elo de 1309, comparado a 1253 do GPT-4-Turbo-2023-04-09 e 1246 do Claude 3 Opus.
A conta oficial da LMSYS observou que a versão pública do GPT-4o agora entrou na arena e em breve aparecerá no ranking público.