El empleado de OpenAI William Fedus confirmó que el misterioso chatbot "gpt-chatbot" que aparece en el ranking de Chatbot Arena es una versión preliminar del recién lanzado modelo GPT-4o. El modelo logró la puntuación más alta jamás registrada en la plataforma durante estas pruebas secretas.

  • OpenAI probó múltiples versiones de GPT-4o en la arena a partir de abril, utilizando alias como "gpt2-chatbot" e "im-also-a-good-gpt2-chatbot".
  • Tras su lanzamiento, GPT-4o superó a los anteriores modelos principales Claude 3 Opus y GPT-4 Turbo por un margen significativo de aproximadamente 50 puntos Elo.
  • Al momento de la impresión, el modelo de prueba tenía una puntuación Elo de 1309, en comparación con 1253 para GPT-4-Turbo-2023-04-09 y 1246 para Claude 3 Opus.

La cuenta oficial de LMSYS señaló que la versión pública de GPT-4o ya ha ingresado a la arena y pronto aparecerá en el ranking público.