ELO Rating90 models ranked

Chatbot Arena ELO Leaderboard 2026

Chatbot Arena ELO ranks models based on human preference in blind side-by-side conversations. It is the most widely cited real-world quality signal because it captures what humans actually prefer — not just benchmark overfitting.

Quick Answer

The best model on Chatbot Arena ELO in 2026 is Claude Opus 4 by Anthropic, scoring 1497 ELO. Runner-up: Claude Sonnet 4 (1473).

90 / 90 models
#ModelScore
🥇Claude Opus 41497ELO
🥈Claude Sonnet 41473ELO
🥉Gemini 2.5 Pro1445ELO
4Claude Haiku 41415ELO
5DeepSeek R11398ELO
6Qwen 2.5 Max1374ELO
7Gemini 2.0 Flash1360ELO
8DeepSeek V31358ELO
9o3-mini1348ELO
10o31340ELO
11o11310ELO
12Qwen 3 235B MoE1310ELO
13Gemini Experimental 12061300ELO
14GPT-4.51290ELO
15DeepSeek R1 (Groq)1290ELO
16Llama 4 Maverick1290ELO
17DeepSeek R1 (Together)1290ELO
18Grok 31285ELO
19Gemini 2.0 Flash Thinking1280ELO
20Claude 3.5 Sonnet1270ELO
21Gemini 2.5 Flash1270ELO
22o1-mini1270ELO
23ChatGPT-4o Latest1265ELO
24o4-mini1260ELO
25QwQ 32B1260ELO
26GPT-4o (Aug 2024)1255ELO
27DeepSeek R1 Distill Llama 70B1250ELO
28Llama 4 Scout1250ELO
29Mistral Large1245ELO
30Command A1240ELO
31DeepSeek R1 Distill Qwen 32B1240ELO
32Llama 3.1 405B (Fireworks)1240ELO
33GPT-4 Turbo1240ELO
34Grok 21240ELO
35Llama 3.1 405B1240ELO
36Sonar Reasoning1240ELO
37Llama 3.1 405B (Together)1240ELO
38Gemini 1.5 Pro1230ELO
39Grok 2 Vision1230ELO
40Pixtral Large1230ELO
41Qwen 2.5 72B1230ELO
42Qwen 2.5 72B (Together)1230ELO
43Amazon Nova Pro1220ELO
44Claude 3.5 Haiku1220ELO
45Llama 3.3 70B (Fireworks)1220ELO
46Llama 3.3 70B (Groq)1220ELO
47Llama 3.3 70B1220ELO
48Mistral Medium 31220ELO
49Llama 3.3 70B (Together)1220ELO
50Llama 3.2 90B Vision1210ELO
51Command R+1200ELO
52DeepSeek V2.51200ELO
53Mixtral 8x22B (Fireworks)1200ELO
54Gemini 2.0 Flash Lite1200ELO
55GPT-4 11200ELO
56Sonar Pro1200ELO
57WizardLM-2 8x22B1200ELO
58Llama 3.1 70B1195ELO
59Phi-3.5 MoE1195ELO
60Gemini 1.5 Flash1190ELO
61Gemma 2 27B1190ELO
62Mistral Small1185ELO
63Yi-Large1185ELO
64GPT-4 1.5-mini1180ELO
65Grok 3-mini1175ELO
66Amazon Nova Lite1170ELO
67Gemma 2 9B (Groq)1170ELO
68Phi-3 Medium1170ELO
69Yi-Lightning1165ELO
70GPT-4o1162ELO
71Gemma 2 9B1160ELO
72Mixtral 8x7B (Groq)1160ELO
73Llama 3.2 11B Vision1160ELO
74Phi-3.5 Mini1160ELO
75Qwen 2.5 7B1160ELO
76Sonar1160ELO
77InternLM 2.5 20B1155ELO
78Gemini 1.5 Flash 8B1150ELO
79GPT-4 1.5-nano1150ELO
80Phi-41150ELO
81Command R1140ELO
82Mistral Nemo 12B1140ELO
83Amazon Nova Micro1130ELO
84Command R7B1120ELO
85GPT-3.5 Turbo1120ELO
86Llama 3.1 8B (Groq)1120ELO
87Llama 3.1 8B1120ELO
88Mistral 7B1100ELO
89Mistral 7B (Together)1100ELO
90GPT-4o Mini1098ELO

What Chatbot Arena ELO Tests

Human preference across open-ended conversations. Models compete head-to-head; wins and losses update the ELO score. Higher ELO = humans prefer this model's output.

Score Range

1100–1400+ (average ~1200)

Compare models side-by-side

Full spec comparison — pricing, context window, and all benchmarks.

Compare Models →