LMSYS的研究人员发布了一个排行榜,使用Elo评分系统来比较大型语言模型,结果显示Anthropic的Claude 3 Opus占据了榜首位置。该模型在由人类投票者评估的一对一对决中获得了1253的Elo评分。
- Claude 3 Opus以33,250张总票数和+5/-5的记录保持最高评分。
- OpenAI的GPT-4预览版模型紧随其后,评分分别为1251和1248。
- Google的Bard (Gemini Pro)排名第四,Elo评分为1203。
- 较旧的GPT-4–0314模型排名第六,评分为1185。
该基准测试提供了一种客观的方法来跟踪语言AI的快速进步,并在主要科技公司之间的竞争加剧时识别领先的架构。