Un employé d'OpenAI, William Fedus, a confirmé que le chatbot mystérieux « gpt-chatbot » apparaissant sur le classement de Chatbot Arena est une version préliminaire du modèle GPT-4o nouvellement lancé. Le modèle a obtenu le score le plus élevé jamais enregistré sur la plateforme lors de ces tests secrets.
- OpenAI a testé plusieurs versions de GPT-4o sur l'arène à partir d'avril, en utilisant des alias tels que « gpt2-chatbot » et « im-also-a-good-gpt2-chatbot ».
- Lors de sa sortie, GPT-4o a dépassé les modèles phares précédents Claude 3 Opus et GPT-4 Turbo avec une marge significative d'environ 50 points Elo.
- Au moment de la rédaction, le modèle testé affichait un score Elo de 1309, contre 1253 pour GPT-4-Turbo-2023-04-09 et 1246 pour Claude 3 Opus.
Le compte officiel de LMSYS a noté que la version publique de GPT-4o est désormais entrée dans l'arène et apparaîtra bientôt sur le classement public.