Back to Leaderboard

7 Independent Sources · 9 Benchmark Leaderboards

Budgets are allocated per capability category; multiple boards share category weight. Missing boards reduce certainty rather than penalizing scores. Select a source on the left to explore details.

Independent Sources 7 Leaderboards 9 Latest Data Sep 4, 2026 Last Checked Sep 4, 2026

Artificial Analysis Intelligence Index

Role: Unified Re-run Comprehensive Index

Re-evaluates current models within a unified benchmark environment for an overall capability score. Pricing is reference-only and excluded from the overall score.

643 models listed
Rank Model Provider Benchmark Score
#1 claude-fable-5-1 Anthropic 65.7
#2 claude-fable-5-1-xhigh Anthropic 64.8
#3 claude-opus-5 Anthropic 63.1
#4 claude-opus-5-xhigh Anthropic 62.5
#4 claude-fable-5-1-high Anthropic 62.5
#6 muse-spark-1-3 Meta 62.1
#6 claude-fable-5 Anthropic 62.1
#8 claude-opus-5-high Anthropic 61.5
#9 gpt-6-astra OpenAI 61.2
#10 gpt-6-astra-xhigh OpenAI 61.0
#11 grok-4-6 xAI 60.9
#11 gpt-5-6-sol OpenAI 60.9
#13 muse-spark-1-3-xhigh Meta 60.8
#14 claude-fable-5-1-medium Anthropic 60.5
#15 gpt-6-astra-high OpenAI 60.3
#16 grok-4-6-xhigh xAI 60.0
#17 kimi-k3 Moonshot AI 59.7
#18 glm-5-3 Z.ai 59.5
#19 gpt-6-astra-medium OpenAI 59.2
#20 grok-4-6-medium xAI 59.0
#20 gpt-5-6-sol-xhigh OpenAI 59.0
#22 gemini-3-8-flash Google 58.7
#23 claude-opus-5-medium Anthropic 58.6
#24 claude-fable-5-1-low Anthropic 58.1
#24 qwen3-8-max Alibaba 58.1
#26 qwen3-8-2-4t-a95b Alibaba 57.7
#27 glm-5-3-flash Z.ai 57.5
#28 gpt-5-6-sol-high OpenAI 57.3
#28 claude-opus-4-8 Anthropic 57.3
#30 muse-spark-1-2 Meta 56.8
#31 gpt-6-astra-low OpenAI 56.7
#32 gemini-3-8-flash-medium Google 56.6
#32 gpt-5-6-terra OpenAI 56.6
#34 gpt-5-5 OpenAI 56.3
#35 gemini-3-7-flash Google 56.0
#36 grok-4-5 xAI 55.8
#36 qwen3-8-flash-next Alibaba 55.8
#38 gpt-5-6-sol-medium OpenAI 55.6
#39 gpt-6-astra-non-reasoning OpenAI 55.3
#39 claude-sonnet-5 Anthropic 55.3
#41 claude-opus-4-7 Anthropic 55.0
#42 gpt-5-5-high OpenAI 54.7
#43 gemini-3-7-flash-medium Google 53.4
#44 deepseek-v4-pro DeepSeek 53.2
#44 muse-spark-1-1 Meta 53.2
#46 gpt-5-4 OpenAI 53.1
#47 gpt-5-6-terra-xhigh OpenAI 52.8
#48 glm-5-2 Z.ai 52.6
#49 claude-opus-5-low Anthropic 52.5
#50 gpt-5-6-luna OpenAI 52.3
#51 gemini-3-5-flash Google 52.0
#51 qwen3-8-27b Alibaba 52.0
#53 deepseek-v4-flash DeepSeek 51.8
#54 gemini-3-8-flash-low Google 51.7
#54 grok-4-6-low xAI 51.7
#56 gemini-3-6-flash Google 51.6
#57 deepseek-v4-flash-vision DeepSeek 51.5
#58 gpt-5-5-medium OpenAI 51.4
#59 gemini-3-7-flash-low Google 50.9
#60 gpt-5-6-sol-low OpenAI 50.7
#61 gpt-5-6-terra-high OpenAI 50.1
#61 gpt-5-6-luna-xhigh OpenAI 50.1
#63 agnes-2-5-pro-beta Sapiens AI 49.1
#64 claude-sonnet-4-6-adaptive Anthropic 48.4
#65 kimi-k3-low Moonshot AI 48.3
#66 gemini-3-1-pro-preview Google 47.7
#67 motif-3 Motif Technologies 47.4
#68 k2-horizon-375b-a23b MBZUAI Institute of Foundation Models 47.3
#69 gpt-5-6-luna-high OpenAI 47.0
#70 gpt-5-6-terra-medium OpenAI 46.8
#71 gemini-3-5-flash-medium Google 46.7
#71 qwen3-7-max Alibaba 46.7
#73 gpt-5-3-codex OpenAI 45.5
#74 minimax-m3 MiniMax 45.4
#75 deepseek-v4-pro-0424 DeepSeek 45.3
#75 motif-0714 Motif Technologies 45.3
#77 kimi-k2-6 Moonshot AI 45.1
#78 claude-opus-4-6-adaptive Anthropic 44.9
#79 gpt-5-5-low OpenAI 44.5
#79 qwen3-8-27b-medium Alibaba 44.5
#81 muse-spark Meta 44.3
#82 apodex-1-1 Apodex 44.0
#83 claude-opus-4-7-non-reasoning Anthropic 43.9
#84 deepseek-v4-pro-0424-high DeepSeek 43.7
#85 gpt-5-2 OpenAI 43.3
#86 kimi-k2-7-code Moonshot AI 43.0
#86 quasar-438b Multiverse Computing 43.0
#88 qwen3-8-27b-low Alibaba 42.9
#88 mimo-v2-5-pro Xiaomi 42.9
#90 claude-sonnet-5-non-reasoning Anthropic 42.6
#91 inkling Other 42.3
#92 hy3 Tencent 42.2
#93 deepseek-v4-flash-0420 DeepSeek 42.1
#94 gpt-5-6-sol-non-reasoning OpenAI 41.9
#94 claude-opus-4-5-thinking Anthropic 41.9
#96 nex-n2-pro Nex AGI 41.7
#97 solar-pro4 upstage 41.6
#98 mimo-v2-pro Xiaomi 41.4
#99 gpt-5-6-terra-low OpenAI 41.3
#100 gpt-5-2-codex OpenAI 41.2
#100 inkling-small Thinking Machines 41.2
#102 qwen3-6-max Alibaba 41.1
#103 glm-5-1 Z.ai 41.0
#104 gpt-5-4-mini OpenAI 40.9
#105 grok-build-0-1-06-16 xAI 40.7
#106 gemini-3-pro Google 40.6
#106 glm-5 Z.ai 40.6
#108 qwen3-6-plus Alibaba 40.5
#109 gpt-5-4-low OpenAI 40.2
#110 jt-4-1-flash-236b-a21b China Mobile 39.9
#111 gpt-5-4-nano OpenAI 39.7
#111 agnes-2-5-pro-alpha Sapiens AI 39.7
#113 qwen3-7-plus Alibaba 39.4
#114 glm-5-turbo Z.ai 39.1
#115 deepseek-v4-flash-0420-high DeepSeek 39.0
#116 gpt-5-2-medium OpenAI 38.9
#116 gpt-5-6-luna-medium OpenAI 38.9
#116 minimax-m2-7 MiniMax 38.9
#119 claude-opus-4-6 Anthropic 38.8
#120 gemini-3-flash-reasoning Google 38.7
#121 nvidia-nemotron-3-ultra-550b-a55b NVIDIA 38.3
#122 grok-4-20 xAI 38.0
#122 mimo-v2-5-0424 Xiaomi 38.0
#124 grok-4-3 xAI 37.9
#125 ling-3-0-flash InclusionAI 37.8
#126 qwen3-6-27b Alibaba 37.7
#127 gpt-5-1 OpenAI 37.5
#128 claude-4-5-sonnet-thinking Anthropic 37.4
#128 grok-4-20-0309 xAI 37.4
#128 gemini-3-5-flash-lite Google 37.4
#128 solar-open2-250b Upstage 37.4
#132 mimo-v2-omni-0327 Xiaomi 37.3
#133 gpt-5-codex OpenAI 37.0
#134 grok-4-3-medium xAI 36.9
#135 claude-sonnet-4-6 Anthropic 36.8
#136 grok-4-3-low xAI 36.3
#136 glm-5-1-non-reasoning Z.ai 36.3
#138 kimi-k2-5 Moonshot AI 36.0
#139 mimo-v2-omni Xiaomi 35.9
#140 gemini-3-5-flash-minimal Google 35.8
#140 gpt-5-5-non-reasoning OpenAI 35.8
#142 claude-opus-4-5 Anthropic 35.6
#142 gpt-5-1-codex OpenAI 35.6
#144 kimi-k2-6-non-reasoning Moonshot AI 35.4
#145 gpt-5 OpenAI 35.3
#145 glm-5v-turbo Z.ai 35.3
#147 claude-sonnet-4-6-non-reasoning-low-effort Anthropic 35.1
#147 muse-glimmer Meta 35.1
#149 a-x-k2 SK Telecom 35.0
#150 glm-5-2-non-reasoning Z.ai 34.8
#151 qwen3-8-27b-non-reasoning Alibaba 34.7
#152 gpt-5-medium OpenAI 34.6
#152 gpt-5-6-terra-non-reasoning OpenAI 34.6
#152 qwen3-5-27b Alibaba 34.6
#155 claude-4-1-opus-thinking Anthropic 34.5
#155 glm-4-7 Z.ai 34.5
#155 minimax-m2-5 MiniMax 34.5
#158 hy3-preview Tencent 34.4
#159 qwen3-5-397b-a17b Alibaba 34.3
#159 gpt-5-5-instant-05-26 OpenAI 34.3
#161 grok-4 xAI 34.1
#162 longcat-2-0 Meituan 34.0
#162 g9v3-39a5b AI9Stars 34.0
#162 mimo-v2-0206 Xiaomi 34.0
#165 gemini-3-pro-low Google 33.9
#165 gpt-5-6-luna-low OpenAI 33.9
#167 kat-coder-pro-v2 Kuaishou 33.7
#168 kimi-k2-thinking Moonshot AI 33.5
#169 o3-pro OpenAI 33.3
#170 glm-5-non-reasoning Z.ai 33.2
#171 deepseek-v3-2-reasoning DeepSeek 32.8
#171 qwen3-5-122b-a10b Alibaba 32.8
#173 qwen3-5-397b-a17b-non-reasoning Alibaba 32.7
#174 qwen3-max-thinking Alibaba 32.5
#175 qwen3-6-35b-a3b Alibaba 32.1
#175 minimax-m2-1 MiniMax 32.1
#177 gpt-5-low OpenAI 31.9
#177 deepseek-v4-pro-0424-non-reasoning DeepSeek 31.9
#177 mimo-v2-flash-reasoning Xiaomi 31.9
#180 claude-4-opus-thinking Anthropic 31.7
#180 ring-2-6-1t InclusionAI 31.7
#182 gpt-5-mini-medium OpenAI 31.6
#183 deepseek-v3-1-terminus-reasoning DeepSeek 31.4
#184 qwen3-6-27b-non-reasoning Alibaba 31.3
#184 gpt-5-1-codex-mini OpenAI 31.3
#184 grok-4-1-fast-reasoning xAI 31.3
#184 qwen3-5-omni-plus Alibaba 31.3
#188 o3 OpenAI 31.1
#189 k-exaone-2-0-0803 LG AI Research 31.0
#190 step-3-7-flash StepFun 30.9
#191 gpt-5-4-nano-medium OpenAI 30.8
#192 gpt-5-4-mini-medium OpenAI 30.5
#193 mistral-medium-3-5 Mistral AI 30.4
#194 kimi-k2-5-non-reasoning Moonshot AI 30.1
#195 qwen3-5-27b-non-reasoning Alibaba 30.0
#196 claude-4-5-sonnet Anthropic 29.9
#196 claude-4-5-haiku-reasoning Anthropic 29.9
#196 qwen3-5-35b-a3b Alibaba 29.9
#199 claude-4-sonnet-thinking Anthropic 29.8
#200 gemma-4-31b Google 29.7
#201 deepseek-v4-flash-non-reasoning DeepSeek 29.3
#201 glm-4-6-reasoning Z.ai 29.3
#203 gpt-5-5-instant-06-26 OpenAI 29.2
#204 jt-35b-flash China Mobile 29.0
#205 kat-coder-pro-v1 Other 28.9
#205 minimax-m2 MiniMax 28.9
#207 claude-4-1-opus Anthropic 28.8
#208 mimo-v2-5-pro-non-reasoning Xiaomi 28.4
#209 gpt-5-4-non-reasoning OpenAI 28.3
#210 qwen3-5-122b-a10b-non-reasoning Alibaba 28.2
#211 gemini-3-flash Google 27.9
#211 grok-4-fast-reasoning xAI 27.9
#213 claude-3-7-sonnet-thinking Anthropic 27.6
#214 glm-4-7-non-reasoning Z.ai 27.1
#215 gpt-5-6-luna-non-reasoning OpenAI 26.8
#216 hy3-non-reasoning Tencent 26.6
#216 ling-2-6-1t InclusionAI 26.6
#218 gpt-5-2-non-reasoning OpenAI 26.5
#218 doubao-seed-code ByteDance 26.5
#218 step-3-5-flash StepFun 26.5
#221 o4-mini OpenAI 26.1
#221 gemma-4-26b-a4b Google 26.1
#223 claude-4-opus Anthropic 26.0
#223 claude-4-sonnet Anthropic 26.0
#223 step-3-5-flash-0202 StepFun 26.0
#226 gemini-2-5-pro Google 25.9
#226 deepseek-v3-2-reasoning-0925 DeepSeek 25.9
#228 gpt-5-mini OpenAI 25.8
#229 nvidia-nemotron-3-super-120b-a12b NVIDIA 25.7
#230 gemini-3-1-flash-lite-preview Google 25.6
#231 qwen3-max-thinking-preview Alibaba 25.5
#232 deepseek-v3-2 DeepSeek 25.1
#232 mimo-v2-flash Xiaomi 25.1
#234 grok-4-3-non-reasoning xAI 25.0
#235 qwen3-6-35b-a3b-non-reasoning Alibaba 24.6
#236 ling-3-0-tiny InclusionAI 24.5
#236 qwen3-max Alibaba 24.5
#238 qwen3-5-35b-a3b-non-reasoning Alibaba 24.3
#239 gemini-2-5-flash-preview-09-2025-reasoning Google 24.2
#240 claude-4-5-haiku Anthropic 24.1
#240 gpt-oss-120b OpenAI 24.1
#242 kimi-k2-0905 Moonshot AI 24.0
#243 claude-3-7-sonnet Anthropic 23.9
#243 o1 OpenAI 23.9
#245 granite-4-2-30b IBM 23.7
#246 nemotron-3-5-lightning NVIDIA 23.6
#247 glm-4-6 Z.ai 23.4
#247 gemini-2-5-pro-03-25 Google 23.4
#249 glm-4-7-flash Z.ai 23.3
#250 grok-4-20-0309-non-reasoning xAI 22.9
#250 grok-3-mini-reasoning xAI 22.9
#252 command-a-plus Cohere 22.8
#253 gemini-2-5-pro-05-06 Google 22.7
#254 deepseek-v3-2-speciale DeepSeek 22.6
#255 k-exaone LG AI Research 22.5
#256 gemma-4-31b-non-reasoning Google 22.3
#256 ernie-5-0-thinking-preview Baidu 22.3
#258 grok-4-20-non-reasoning xAI 22.2
#258 gemma-4-12b Google 22.2
#260 nova-2-0-pro-reasoning-medium Amazon 22.1
#261 grok-code-fast-1 xAI 22.0
#262 mercury-2 inception-ai 21.9
#263 qwen3-5-9b Alibaba 21.8
#264 deepseek-v3-1-terminus DeepSeek 21.7
#264 deepseek-v3-2-0925 DeepSeek 21.7
#266 apriel-v1-5-15b-thinker ServiceNow 21.6
#267 deepseek-v3-1 DeepSeek 21.4
#268 nova-2-0-omni-reasoning-medium Amazon 21.3
#268 qwen3-coder-next Alibaba 21.3
#270 deepseek-v3-1-reasoning DeepSeek 21.0
#271 qwen3-vl-235b-a22b-reasoning Alibaba 20.9
#272 nova-2-0-lite-reasoning Amazon 20.8
#272 apriel-v1-6-15b-thinker ServiceNow 20.8
#274 gpt-5-1-non-reasoning OpenAI 20.7
#275 qwen3-5-9b-non-reasoning Alibaba 20.6
#276 exaone-4-5-33b LG AI 20.5
#277 gemma-4-26b-a4b-non-reasoning Google 20.4
#277 deepseek-r1 DeepSeek 20.4
#277 qwen3-5-4b Alibaba 20.4
#280 gemini-2-5-flash-reasoning Google 20.3
#281 north-mini-code Cohere 20.2
#282 gpt-5-nano OpenAI 20.1
#283 qwen3-235b-a22b-instruct-2507-reasoning Alibaba 19.9
#284 nova-2-0-pro-reasoning-low Amazon 19.8
#285 glm-4.5 Z.ai 19.7
#285 mistral-small-4 Mistral AI 19.7
#285 kimi-k2 Moonshot AI 19.7
#288 gpt-4-1 OpenAI 19.6
#288 granite-4-2-8b IBM 19.6
#290 qwen3-max-preview Alibaba 19.4
#291 gpt-5-nano-medium OpenAI 19.2
#291 nova-2-0-lite-reasoning-medium Amazon 19.2
#291 o3-mini OpenAI 19.2
#291 devstral-2 Mistral AI 19.2
#291 qwen3-5-omni-flash Alibaba 19.2
#296 gemini-2-5-flash-preview-09-2025 Google 19.1
#296 o1-pro OpenAI 19.1
#298 jt-mini China Mobile 18.8
#299 trinity-large-thinking Other 18.7
#300 deepseek-r1-0120 DeepSeek 18.6
#300 grok-3 xAI 18.6
#302 seed-oss-36b-instruct ByteDance 18.5
#303 qwen3-235b-a22b-instruct-2507 Alibaba 18.4
#304 hypernova-60b Multiverse Computing 18.3
#305 qwen3-coder-480b-a35b-instruct Alibaba 18.2
#306 qwen3-vl-32b-reasoning Alibaba 18.1
#307 nova-2-0-lite-reasoning-low Amazon 18.0
#307 magistral-medium-2509 Mistral AI 18.0
#307 sonar-reasoning-pro Perplexity 18.0
#310 minimax-m1-80k MiniMax 17.9
#311 gpt-5-4-nano-non-reasoning OpenAI 17.8
#311 nemotron-cascade-2-30b-a3b NVIDIA 17.8
#313 gemini-2-5-flash-reasoning-04-2025 Google 17.7
#313 devstral-small-2 Mistral AI 17.7
#315 k2-think-v2 LLM360 17.4
#315 longcat-flash-lite Meituan 17.4
#317 gpt-5-minimal OpenAI 17.3
#318 hyperclova-x-seed-think-32b Naver 17.2
#318 o1-preview OpenAI 17.2
#320 grok-4-1-fast xAI 17.0
#321 k-exaone-non-reasoning LG AI Research 16.9
#321 glm-4-6v-reasoning Z.ai 16.9
#321 qwen3-next-80b-a3b-reasoning Alibaba 16.9
#324 gpt-5-4-mini-non-reasoning OpenAI 16.8
#325 nova-2-0-omni-reasoning-low Amazon 16.7
#325 glm-4-5-air Z.ai 16.7
#327 grok-4-fast xAI 16.6
#327 mi-dm-k-2-5-pro-dec28 Korea Telecom 16.6
#329 ring-1t InclusionAI 16.3
#330 g9v3-3b AI9Stars 16.2
#331 qwen3-5-4b-non-reasoning Alibaba 16.1
#332 mistral-large-3 Mistral AI 15.9
#333 o3-mini-high OpenAI 15.7
#333 intellect-3 Other 15.7
#335 glm-4-7-flash-non-reasoning Z.ai 15.6
#336 gpt-5-chatgpt OpenAI 15.4
#337 gpt-oss-20b OpenAI 15.2
#337 gemini-2-5-flash-lite-preview-09-2025-reasoning Google 15.2
#337 solar-open-100b-reasoning Upstage 15.2
#337 deepseek-v3-0324 DeepSeek 15.2
#337 grok-3-reasoning xAI 15.2
#342 nemotron-3-nano-omni-30b-a3b NVIDIA 15.0
#343 gpt-oss-120b-low OpenAI 14.9
#343 mistral-small-3-1 Mistral AI 14.9
#345 gpt-4-1-mini OpenAI 14.8
#346 mistral-medium-3-1 Mistral AI 14.7
#347 qwen3-30b-a3b-2507-reasoning Alibaba 14.6
#348 nvidia-nemotron-3-nano-30b-a3b-reasoning NVIDIA 14.5
#348 llama-4-maverick Meta 14.5
#348 minimax-m1-40k MiniMax 14.5
#348 solar-pro-3 Upstage 14.5
#352 gpt-oss-20b-low OpenAI 14.4
#352 nova-2-0-pro Amazon 14.4
#352 qwen3-vl-235b-a22b-instruct Alibaba 14.4
#355 gpt-5-mini-minimal OpenAI 14.3
#355 granite-4-2-3b IBM 14.3
#357 gemini-2-5-flash Google 14.2
#357 k2-v2 MBZUAI Institute of Foundation Models 14.2
#357 deepseek-v3 DeepSeek 14.2
#357 ling-2-6-flash InclusionAI 14.2
#361 o1-mini OpenAI 14.0
#362 qwen3-next-80b-a3b-instruct Alibaba 13.8
#363 gpt-4-5 OpenAI 13.6
#363 qwen3-coder-30b-a3b-instruct Alibaba 13.6
#363 tri-21b-think-preview Trillion Labs 13.6
#366 qwen3-235b-a22b-instruct-reasoning Alibaba 13.5
#366 diffusiongemma-26b-a4b Google 13.5
#368 qwq-32b Alibaba 13.4
#368 qwen3-vl-30b-a3b-reasoning Alibaba 13.4
#370 gemini-2-0-flash-thinking-exp-0121 Google 13.3
#371 gemma-4-12b-non-reasoning Google 13.2
#372 gemini-2-5-flash-lite-preview-09-2025 Google 13.1
#373 motif-2-12-7b Motif Technologies 12.8
#374 ling-1t InclusionAI 12.7
#374 nova-premier Amazon 12.7
#376 solar-pro-2-preview-reasoning Upstage 12.5
#376 magistral-medium Mistral AI 12.5
#376 mistral-medium-3 Mistral AI 12.5
#379 k2-v2-medium MBZUAI Institute of Foundation Models 12.4
#379 llama-nemotron-super-49b-v1-5-reasoning NVIDIA 12.4
#379 celeris-1 Celeris 12.4
#379 devstral-medium Mistral AI 12.4
#383 mistral-small-4-non-reasoning Mistral AI 12.3
#383 gpt-4o-chatgpt-03-25 OpenAI 12.3
#383 tri-21b-think-v0-5 Trillion Labs 12.3
#386 gemma-4-e4b Google 12.2
#386 llama-3-3-nemotron-super-49b-reasoning NVIDIA 12.2
#386 claude-3-5-haiku Anthropic 12.2
#386 gemini-2-0-flash Google 12.2
#390 sarvam-105b Sarvam AI 11.9
#390 minicpm5-1b OpenBMB 11.9
#390 qwen3-4b-2507-instruct-reasoning Alibaba 11.9
#393 nova-2-0-lite Amazon 11.8
#393 gemini-2-0-pro-experimental-02-05 Google 11.8
#393 claude-3-opus Anthropic 11.8
#393 devstral-small-2505 Mistral AI 11.8
#397 minicpm5-1b-non-reasoning OpenBMB 11.7
#398 gemini-2-5-flash-04-2025 Google 11.6
#398 sonar-reasoning Perplexity 11.6
#400 magistral-small-2509 Mistral AI 11.5
#401 gemini-2-5-flash-lite-reasoning Google 11.4
#401 qwen3-32b-instruct-reasoning Alibaba 11.4
#403 ministral-3-14b Mistral AI 11.2
#404 gpt-4o OpenAI 11.1
#405 deepseek-r1-distill-qwen-32b DeepSeek 11.0
#405 lfm2-5-2-6b Liquid AI 11.0
#405 nanbeige4-1-3b Nanbeige 11.0
#405 qwen3-vl-32b-instruct Alibaba 11.0
#409 glm-4-6v Z.ai 10.9
#410 qwen3-235b-a22b-instruct Alibaba 10.8
#411 mistral-small-3-2 Mistral AI 10.7
#412 gemini-2-0-flash-experimental Google 10.6
#412 magistral-small Mistral AI 10.6
#414 exaone-4-0-32b-reasoning LG AI Research 10.5
#414 qwen3-vl-8b-reasoning Alibaba 10.5
#416 nova-2-0-omni Amazon 10.4
#416 qwen3-14b-instruct-reasoning Alibaba 10.4
#418 llama-4-scout Meta 10.3
#418 deepseek-r1-qwen3-8b DeepSeek 10.3
#420 qwen-2-5-max Alibaba 10.1
#421 solar-pro-2-preview Upstage 9.9
#421 hermes-4-llama-3-1-70b-reasoning Nous Research 9.9
#421 gemini-1-5-pro Google 9.9
#421 qwen3-vl-30b-a3b-instruct Alibaba 9.9
#425 claude-35-sonnet Anthropic 9.8
#425 deepseek-r1-distill-llama-70b DeepSeek 9.8
#427 deepseek-r1-distill-qwen-14b DeepSeek 9.7
#427 falcon-h1r-7b TII 9.7
#429 gpt-4-1-nano OpenAI 9.6
#429 ling-flash-2-0 ant-group 9.6
#431 gemma-4-e2b Google 9.5
#431 qwen3-omni-30b-a3b-reasoning Alibaba 9.5
#433 gpt-4o-2024-08-06 OpenAI 9.4
#433 qwen2-5-72b-instruct Alibaba 9.4
#433 sonar Perplexity 9.4
#436 llama-3-3-instruct-70b Meta 9.3
#436 step-3-vl-10b StepFun 9.3
#438 qwen3-30b-a3b-instruct-reasoning Alibaba 9.2
#439 devstral-small Mistral AI 9.1
#439 QwQ-32B-Preview Alibaba 9.1
#439 sonar-pro Perplexity 9.1
#442 glm-4-5v-reasoning Z.ai 9.0
#442 ministral-3-8b Mistral AI 9.0
#442 mistral-large-2 Mistral AI 9.0
#445 llama-3-1-nemotron-ultra-253b-v1-reasoning NVIDIA 8.9
#445 ernie-4-5-300b-a47b Baidu 8.9
#445 qwen3-30b-a3b-2507 Alibaba 8.9
#448 hermes-4-llama-3-1-405b-reasoning Nous Research 8.8
#448 nvidia-nemotron-nano-12b-v2-vl-reasoning NVIDIA 8.8
#448 solar-pro-2-reasoning Upstage 8.8
#451 gemma-4-e4b-non-reasoning Google 8.7
#451 nvidia-nemotron-nano-9b-v2-reasoning NVIDIA 8.7
#451 granite-4-1-30b IBM 8.7
#454 hermes-4-llama-3-1-405b Nous Research 8.6
#454 gemini-2-0-flash-lite-001 Google 8.6
#454 nvidia-nemotron-3-nano-4b NVIDIA 8.6
#457 llama-nemotron-super-49b-v1-5 NVIDIA 8.5
#457 qwen3-32b-instruct Alibaba 8.5
#459 k2-v2-low MBZUAI Institute of Foundation Models 8.4
#459 llama-3-1-nemotron-nano-4b-reasoning NVIDIA 8.4
#459 gemini-2-0-flash-lite-preview Google 8.4
#459 gpt-4o-2024-05-13 OpenAI 8.4
#459 kimi-linear-48b-a3b-instruct Moonshot AI 8.4
#464 llama-3-3-nemotron-super-49b NVIDIA 8.3
#464 qwen3-8b-instruct-reasoning Alibaba 8.3
#464 llama-3-1-instruct-405b Meta 8.3
#467 qwen3-4b-instruct-reasoning Alibaba 8.2
#467 qwen3-vl-8b-instruct Alibaba 8.2
#469 claude-35-sonnet-june-24 Anthropic 8.1
#469 gpt-4o-chatgpt OpenAI 8.1
#469 lfm2-5-8b-a1b Liquid AI 8.1
#469 tulu3-405b Meta 8.1
#473 ring-flash-2-0 ant-group 8.0
#473 pixtral-large-2411 Mistral AI 8.0
#475 olmo-3-1-32b-think Allen AI 7.9
#476 gpt-5-nano-minimal OpenAI 7.8
#476 gemini-1-5-flash Google 7.8
#476 grok-2-1212 xAI 7.8
#479 qwen3-vl-4b-reasoning Alibaba 7.7
#479 gpt-4-turbo OpenAI 7.7
#481 solar-pro-2 Upstage 7.6
#482 command-a Cohere 7.5
#482 nova-pro Amazon 7.5
#484 qwen3-5-2b Alibaba 7.4
#484 gemma-3-27b Google 7.4
#484 llama-3-1-instruct-8b Meta 7.4
#484 llama-3-1-nemotron-instruct-70b NVIDIA 7.4
#488 grok-beta xAI 7.3
#489 nvidia-nemotron-3-nano-30b-a3b NVIDIA 7.2
#489 nvidia-nemotron-nano-9b-v2 NVIDIA 7.2
#489 qwen2.5-32b-instruct Alibaba 7.2
#492 ministral-3-3b Mistral AI 7.1
#493 mistral-large-2407 Mistral AI 7.0
#494 qwen2-5-coder-32b-instruct Alibaba 6.9
#494 qwen3-4b-2507-instruct Alibaba 6.9
#496 glm-4-5v Z.ai 6.8
#496 qwen3-14b-instruct Alibaba 6.8
#496 gpt-4 OpenAI 6.8
#499 gemini-2-5-flash-lite Google 6.7
#499 hermes-4-llama-3-1-70b Nous Research 6.7
#499 gpt-4o-mini OpenAI 6.7
#499 mistral-small-3 Mistral AI 6.7
#499 nova-lite Amazon 6.7
#504 qwen3-30b-a3b-instruct Alibaba 6.6
#505 qwen3-4b-instruct Alibaba 6.5
#505 deepseek-v2-5 DeepSeek 6.5
#505 llama-3-1-instruct-70b Meta 6.5
#508 sarvam-30b Sarvam AI 6.4
#508 deepseek-v2-5-sep-2024 DeepSeek 6.4
#508 gemini-2-0-flash-thinking-exp-1219 Google 6.4
#508 granite-4-1-8b ibm 6.4
#512 gemma-4-e2b-non-reasoning Google 6.2
#512 deepseek-r1-distill-llama-8b DeepSeek 6.2
#512 mistral-saba Mistral AI 6.2
#512 olmo-3-1-32b-instruct allenai 6.2
#516 gemini-1-5-pro-may-2024 Google 6.1
#516 olmo-3-32b-think Allen AI 6.1
#518 llama-3-2-instruct-90b-vision Meta 6.0
#518 qwen-turbo Alibaba 6.0
#518 r1-1776 Perplexity 6.0
#518 reka-flash Reka AI 6.0
#518 solar-mini Upstage 6.0
#523 grok-1 xAI 5.8
#524 exaone-4-0-32b LG AI Research 5.7
#524 phi-4-mini Microsoft 5.7
#524 qwen2-72b-instruct Alibaba 5.7
#527 gemma-3-12b Google 5.5
#528 qwen3-5-2b-non-reasoning Alibaba 5.3
#529 qwen3-5-0-8b Alibaba 5.2
#529 gemini-1-5-flash-8b Google 5.2
#531 deephermes-3-mistral-24b-preview Nous Research 5.0
#531 jamba-1-7-large AI21 Labs 5.0
#533 granite-4-0-h-small IBM 4.9
#534 qwen3-8b-instruct Alibaba 4.8
#534 hermes-3-llama-3-1-70b Nous Research 4.8
#534 jamba-1-5-large Other 4.8
#534 qwen3-omni-30b-a3b-instruct Alibaba 4.8
#538 deepseek-coder-v2 DeepSeek 4.7
#538 jamba-1-6-large AI21 Labs 4.7
#538 olmo-2-32b Allen AI 4.7
#541 phi-4 Microsoft 4.6
#541 gemini-1-5-flash-may-2024 Google 4.6
#541 lfm2-24b-a2b Liquid AI 4.6
#544 claude-3-sonnet Anthropic 4.4
#544 granite-4-1-3b IBM 4.4
#544 nova-micro Amazon 4.4
#547 gemini-1-0-ultra Google 4.3
#547 mistral-small Mistral AI 4.3
#547 phi-3-mini Microsoft 4.3
#550 nvidia-nemotron-nano-12b-v2-vl NVIDIA 4.2
#550 gemma-3n-e4b-preview-0520 Google 4.2
#550 phi-4-multimodal Microsoft 4.2
#553 mistral-large Mistral AI 4.1
#553 qwen2-5-coder-7b-instruct Alibaba 4.1
#555 mistral-8x22b-instruct Mistral AI 4.0
#556 llama-2-chat-7b Meta 3.9
#556 llama-3-2-instruct-3b Meta 3.9
#558 jamba-reasoning-3b AI21 Labs 3.8
#558 minicpm-v4-6-1-3b OpenBMB 3.8
#560 qwen1.5-110b-chat Alibaba 3.7
#560 qwen3-vl-4b-instruct Alibaba 3.7
#560 reka-flash-3 Reka 3.7
#563 olmo-3-7b-think Allen AI 3.6
#564 claude-21 Anthropic 3.5
#564 claude-3-haiku Anthropic 3.5
#564 olmo-2-7b Allen AI 3.5
#567 ling-mini-2-0 InclusionAI 3.4
#567 molmo-7b-d Allen Institute for AI 3.4
#569 claude-2 Anthropic 3.3
#569 deepseek-r1-distill-qwen-1-5b DeepSeek 3.3
#569 deepseek-v2 DeepSeek 3.3
#572 gpt-35-turbo OpenAI 3.2
#572 mistral-medium Mistral AI 3.2
#572 mistral-small-2402 Mistral AI 3.2
#575 llama-3-instruct-70b Meta 3.1
#576 arctic-instruct Snowflake 3.0
#576 lfm-40b Liquid AI 3.0
#576 llama-3-2-instruct-11b-vision Meta 3.0
#576 qwen-chat-72b Alibaba 3.0
#580 qwen3-5-0-8b-non-reasoning Alibaba 2.9
#581 palm-2 Google 2.8
#582 deepseek-coder-v2-lite DeepSeek 2.7
#582 gemini-1-0-pro Google 2.7
#584 sarvam-m-reasoning Sarvam 2.6
#584 command-r-plus-04-2024 Cohere 2.6
#584 dbrx Other 2.6
#584 deepseek-llm-67b-chat DeepSeek 2.6
#584 llama-2-chat-13b Meta 2.6
#584 llama-2-chat-70b Meta 2.6
#584 openchat-35 OpenChat 2.6
#591 exaone-4-0-1-2b-reasoning LG AI Research 2.5
#592 exaone-4-0-1-2b LG AI Research 2.4
#592 olmo-3-7b-instruct Allen AI 2.4
#594 jamba-1-5-mini Other 2.3
#594 jamba-1-7-mini AI21 Labs 2.3
#594 lfm2-2-6b Liquid AI 2.3
#594 lfm2-5-1-2b-instruct Liquid AI 2.3
#594 lfm2-5-1-2b-thinking Liquid AI 2.3
#599 qwen3-1.7b-instruct-reasoning Alibaba 2.2
#599 granite-4-0-h-nano-1b IBM 2.2
#601 jamba-1-6-mini AI21 Labs 2.1
#602 apertus-70b-instruct Apertus 2.0
#602 gemma-3-270m Google 2.0
#602 granite-4-0-micro IBM 2.0
#602 mixtral-8x7b-instruct Mistral AI 2.0
#606 deephermes-3-llama-3-1-8b-preview Nous Research 1.9
#607 claude-instant Anthropic 1.7
#607 command-r-03-2024 Cohere 1.7
#607 llama-65b Meta 1.7
#607 mistral-7b-instruct Mistral AI 1.7
#607 qwen-chat-14b Alibaba 1.7
#612 granite-4-0-nano-1b IBM 1.6
#612 molmo2-8b allenai 1.6
#614 granite-3-3-8b-instruct IBM 1.3
#614 lfm2-8b-a1b Liquid AI 1.3
#616 qwen3-1.7b-instruct Alibaba 1.1
#617 qwen3-0.6b-instruct Alibaba 1.0
#617 qwen3-0.6b-instruct-reasoning Alibaba 1.0
#617 granite-4-0-350m IBM 1.0
#617 apertus-8b-instruct Apertus 1.0
#617 gemma-3-1b Google 1.0
#617 gemma-3-4b Google 1.0
#617 gemma-3n-e2b Google 1.0
#617 gemma-3n-e4b Google 1.0
#617 granite-4-0-h-350m IBM 1.0
#617 lfm2-1-2b Liquid AI 1.0
#617 lfm2-5-vl-1-6b Liquid AI 1.0
#617 llama-3-2-instruct-1b Meta 1.0
#617 llama-3-instruct-8b Meta 1.0
#617 tiny-aya-global Cohere 1.0
#631 claude-sonnet-5-high Anthropic 0.0
#631 claude-sonnet-5-low Anthropic 0.0
#631 claude-sonnet-5-medium Anthropic 0.0
#631 claude-sonnet-5-xhigh Anthropic 0.0
#631 exaone-4-5-33b-non-reasoning LG AI 0.0
#631 cogito-v2-1-reasoning Deep Cogito 0.0
#631 gpt-5-4-pro OpenAI 0.0
#631 gpt-5-5-pro OpenAI 0.0
#631 gemini-3-deep-think Google 0.0
#631 gpt-3-5-turbo-0613 OpenAI 0.0
#631 gpt-4o-mini-realtime-dec-2024 OpenAI 0.0
#631 gpt-4o-realtime-dec-2024 OpenAI 0.0
#631 midm-250-pro-rsnsft Korea Telecom 0.0

Artificial Analysis Multilingual Index

Role: Chinese & Multilingual Capability Benchmark

Independently evaluates LLM performance across Chinese semantic understanding, local knowledge, and complex multilingual tasks.

Evaluation data for this benchmark is currently being updated and will be available soon.

LiveBench Global Average

Role: Monthly Objective Contamination-Free Capability Average

Releases monthly new contamination-free questions across reasoning, coding, math, data analysis, IF, and language to prevent benchmark gaming.

53 models listed
Rank Model Provider Benchmark Score
#1 claude-fable-5-1-max-effort Anthropic 83.4
#2 claude-fable-5-max-effort Anthropic 83.0
#3 muse-spark-1.3-xhigh Meta 81.6
#4 gpt-5.6-sol-max OpenAI 81.1
#5 gpt-5.5-xhigh OpenAI 80.2
#6 claude-opus-5-max-effort Anthropic 80.1
#7 smaug-agentic Other 79.5
#8 kimi-k3 Moonshot AI 79.2
#9 gemini-3.7-flash-high Google 78.8
#10 qwen3.8-max Alibaba 78.5
#11 grok-4.6 xAI 78.0
#12 gpt-5.4-xhigh OpenAI 78.0
#13 muse-spark-1.2-xhigh Meta 78.0
#14 gpt-5.6-terra-max OpenAI 77.9
#15 deepseek-v4-pro-0813 DeepSeek 77.4
#16 gemini-3.1-pro-preview-high Google 77.0
#17 deepseek-v4-flash-vision-exp DeepSeek 76.8
#18 claude-opus-4-7-xhigh-effort Anthropic 76.5
#19 claude-opus-4-8-max-effort Anthropic 76.2
#20 qwen3.8-flash-next Alibaba 76.2
#21 glm-5.3 Z.ai 76.1
#22 claude-sonnet-5-xhigh-effort Anthropic 76.0
#23 gemini-3.8-flash-high Google 75.8
#24 grok-4.5 xAI 75.8
#25 muse-spark-1.1-xhigh Meta 75.3
#26 qwen3.8-27b Alibaba 75.3
#27 gemini-3.5-flash-high Google 74.6
#28 gpt-5.2-2025-12-11-high OpenAI 74.6
#29 claude-opus-4-6-thinking-auto-high-effort Anthropic 74.5
#30 deepseek-v4-flash-0731 DeepSeek 74.2
#31 gpt-5.2-codex OpenAI 74.0
#32 gemini-3.6-flash-high Google 73.6
#33 gpt-5.6-luna-max OpenAI 73.6
#34 glm-5.2 Z.ai 73.2
#35 qwen3.7-max Alibaba 73.1
#36 claude-sonnet-4-6-thinking-auto-medium-effort Anthropic 73.0
#37 claude-opus-4-5-20251101-thinking-64k-high-effort Anthropic 72.6
#38 inkling-xhigh Other 71.9
#39 glm-5.3-flash Z.ai 71.6
#40 deepseek-v4-pro DeepSeek 71.6
#41 kimi-k2.6-thinking Moonshot AI 70.5
#42 gpt-5.4-nano-xhigh OpenAI 69.6
#43 ox-alpha-max Other 69.2
#44 qwen3.6-plus Alibaba 68.9
#45 kimi-k2.7-code Moonshot AI 68.4
#46 grok-build-0.1 xAI 67.8
#47 nemotron-3-ultra-550b-a55b NVIDIA 67.4
#48 minimax-m3 MiniMax 67.3
#49 gpt-5.4-mini-xhigh OpenAI 66.4
#50 deepseek-v4-flash DeepSeek 65.5
#51 qwen3.6-27b Alibaba 64.0
#52 gemini-3.5-flash-lite-high Google 63.9
#53 grok-4.3 xAI 62.2

Arena Text Style-Controlled

Role: Human Blind Text Preference (Style-Controlled Elo)

Computes Elo ratings from large-scale human blind battle tests, adjusted for length bias and Markdown formatting.

398 models listed
Rank Model Provider Benchmark Score
#1 claude-fable-5 Anthropic 1507
#2 claude-opus-4-6-high Anthropic 1505
#3 claude-opus-4-7-high Anthropic 1502
#4 muse-spark-1.2 (xHigh) Meta 1499
#5 claude-opus-4-6 Anthropic 1498
#6 claude-opus-4-7 Anthropic 1494
#7 claude-opus-5-high Anthropic 1492
#8 muse-spark-1.1 Meta 1492
#9 gemini-3.7-flash-high Google 1491
#10 kimi-k3-max Moonshot AI 1489
#11 muse-spark Meta 1488
#12 claude-opus-5-max Anthropic 1488
#13 gemini-3.1-pro-preview Google 1487
#14 gemini-3-pro Google 1486
#15 glm-5.3-max Z.ai 1483
#16 gpt-5.6-sol-xhigh OpenAI 1483
#17 gpt-5.5-high OpenAI 1482
#18 claude-opus-4-8-high Anthropic 1482
#19 gemini-3.6-flash-high Google 1480
#20 qwen3.8-max Alibaba 1479
#21 gemini-3.5-flash-high Google 1479
#22 gpt-5.5 OpenAI 1477
#23 gpt-5.4-high OpenAI 1476
#24 gpt-5.2-chat-latest-20260210 OpenAI 1476
#25 grok-4.20-beta1 xAI 1475
#26 gemini-3.5-flash-medium Google 1474
#27 glm-5.3-flash Z.ai 1474
#28 gemini-3-flash Google 1474
#29 qwen3.7-max-preview Alibaba 1474
#30 gpt-5.5-instant OpenAI 1474
#31 claude-opus-4-8 Anthropic 1473
#32 claude-opus-4-5-20251101-high-32k Anthropic 1473
#33 claude-sonnet-4-6 Anthropic 1472
#34 glm-5.2-max Z.ai 1472
#35 grok-4.20-beta-0309-reasoning xAI 1472
#36 grok-4.20-multi-agent-beta-0309 xAI 1471
#37 grok-4.5 xAI 1470
#38 claude-opus-4-5-20251101 Anthropic 1469
#39 mimo-v2.5-pro Xiaomi 1468
#40 ernie-5.1 Baidu 1468
#41 gpt-5.6-terra-xhigh OpenAI 1466
#42 glm-5.1 Z.ai 1466
#43 grok-4.1-thinking xAI 1466
#44 gpt-5.4 OpenAI 1466
#45 qwen3.5-max-preview Alibaba 1466
#46 claude-sonnet-5-high Anthropic 1462
#47 grok-4.6-high xAI 1461
#48 kimi-k2.6 Moonshot AI 1461
#49 qwen3.6-max-preview Alibaba 1460
#50 deepseek-v4-pro-high-20260813 DeepSeek 1460
#51 grok-4.1 xAI 1459
#52 gemini-3-flash (thinking-minimal) Google 1458
#53 glm-5 Z.ai 1458
#54 deepseek-v4-pro DeepSeek 1458
#55 gemini-3.5-flash-lite Google 1457
#56 claude-sonnet-4-5-20250929-high-32k Anthropic 1456
#57 dola-seed-2.0-pro ByteDance 1456
#58 hy3 Tencent 1455
#59 qwen3.7-plus Alibaba 1455
#60 claude-sonnet-4-5-20250929 Anthropic 1455
#61 gpt-5.1-high OpenAI 1455
#62 deepseek-v4-pro-high-preview DeepSeek 1455
#63 gpt-5.6-luna-xhigh OpenAI 1452
#64 gemma-4-31b Google 1451
#65 kimi-k2.5-thinking Moonshot AI 1451
#66 claude-opus-4-1-20250805-thinking-16k Anthropic 1450
#67 gpt-5.3-chat-latest OpenAI 1449
#68 ernie-5.0-preview-1203 Baidu 1449
#69 mimo-v2-pro Xiaomi 1448
#70 gpt-5.4-mini-high OpenAI 1448
#71 claude-opus-4-1-20250805 Anthropic 1448
#72 ernie-5.0-0110 Baidu 1446
#73 gemini-2.5-pro Google 1446
#74 gpt-4.5-preview-2025-02-27 OpenAI 1445
#75 qwen3.6-plus Alibaba 1444
#76 chatgpt-4o-latest-20250326 OpenAI 1443
#77 minimax-m3 MiniMax 1443
#78 grok-4.3 xAI 1443
#79 glm-4.7 Z.ai 1442
#80 qwen3.5-397b-a17b Alibaba 1441
#81 inkling Other 1439
#82 gpt-5.1 OpenAI 1439
#83 deepseek-v4-flash-high-preview DeepSeek 1438
#84 gemma-4-26b-a4b Google 1438
#85 gpt-5.2-high OpenAI 1438
#86 gpt-5.2 OpenAI 1436
#87 deepseek-v4-flash DeepSeek 1436
#88 longcat-flash-chat-2602-exp meituan 1436
#89 qwen3.8-27b Alibaba 1435
#90 qwen3-max-preview Alibaba 1435
#91 gpt-5-high OpenAI 1434
#92 mimo-v2.5 Xiaomi 1434
#93 glm-5v-turbo Z.ai 1433
#94 gemini-3.1-flash-lite-preview Google 1432
#95 o3-2025-04-16 OpenAI 1431
#96 kimi-k2.5-instant Moonshot AI 1431
#97 grok-4-1-fast-reasoning xAI 1430
#98 kimi-k2-thinking-turbo Moonshot AI 1430
#99 mimo-v2-omni Xiaomi 1430
#100 muse-glimmer Meta 1427
#101 mistral-medium-3.5 Mistral AI 1427
#102 gpt-5-chat OpenAI 1427
#103 nvidia-nemotron-3-ultra-550b-a55b-nvfp4 NVIDIA 1426
#104 claude-opus-4-20250514-thinking-16k Anthropic 1426
#105 amazon-nova-experimental-chat-26-02-10 Amazon 1426
#106 deepseek-v3.2 DeepSeek 1425
#107 deepseek-v3.2-exp-thinking DeepSeek 1425
#108 glm-4.6 Z.ai 1425
#109 qwen3-max-2025-09-23 Alibaba 1424
#110 qwen3-235b-a22b-instruct-2507 Alibaba 1423
#111 deepseek-v3.2-thinking DeepSeek 1423
#112 deepseek-v3.2-exp DeepSeek 1422
#113 deepseek-r1-0528 DeepSeek 1421
#114 ernie-5.0-preview-1022 Baidu 1419
#115 grok-4-fast-chat xAI 1418
#116 kimi-k2-0905-preview Moonshot AI 1418
#117 kimi-k2-0711-preview Moonshot AI 1418
#118 deepseek-v3.1 DeepSeek 1417
#119 qwen3.5-122b-a10b Alibaba 1417
#120 deepseek-v3.1-terminus-thinking DeepSeek 1417
#121 deepseek-v3.1-thinking DeepSeek 1416
#122 minimax-m2.7 MiniMax 1416
#123 amazon-nova-experimental-chat-26-01-10 Amazon 1415
#124 deepseek-v3.1-terminus DeepSeek 1415
#125 gpt-4.1-2025-04-14 OpenAI 1414
#126 claude-opus-4-20250514 Anthropic 1414
#127 qwen3-vl-235b-a22b-instruct Alibaba 1414
#128 mistral-large-3 Mistral AI 1414
#129 claude-haiku-4-5-20251001 Anthropic 1413
#130 hunyuan-hy3-preview Tencent 1413
#131 grok-3-preview-02-24 xAI 1411
#132 glm-4.5 Z.ai 1411
#133 grok-4-0709 xAI 1411
#134 gemini-2.5-flash Google 1410
#135 mistral-medium-2508 Mistral AI 1409
#136 qwen3.5-27b Alibaba 1408
#137 Inkling Small Thinking Machines 1406
#138 grok-4-fast-reasoning xAI 1405
#139 gemini-2.5-flash-preview-09-2025 Google 1404
#140 qwen3-235b-a22b-no-thinking Alibaba 1402
#141 gpt-5.4-nano-high OpenAI 1402
#142 o1-2024-12-17 OpenAI 1402
#143 longcat-flash-chat meituan 1402
#144 claude-sonnet-4-20250514-thinking-32k Anthropic 1401
#145 qwen3-235b-a22b-thinking-2507 Alibaba 1400
#146 qwen3-next-80b-a3b-instruct Alibaba 1399
#147 deepseek-r1 DeepSeek 1398
#148 qwen3.5-flash Alibaba 1397
#149 deepseek-v3-0324 DeepSeek 1396
#150 hunyuan-vision-1.5-thinking Tencent 1395
#151 qwen3.5-35b-a3b Alibaba 1395
#152 qwen3-vl-235b-a22b-thinking Alibaba 1395
#153 amazon-nova-experimental-chat-12-10 Amazon 1395
#154 step-3.5-flash StepFun 1394
#155 mimo-v2-flash (non-thinking) Xiaomi 1392
#156 o4-mini-2025-04-16 OpenAI 1391
#157 minimax-m2.5 MiniMax 1391
#158 claude-sonnet-4-20250514 Anthropic 1390
#159 gpt-5-mini-high OpenAI 1389
#160 o1-preview OpenAI 1388
#161 claude-3-7-sonnet-20250219-thinking-32k Anthropic 1388
#162 hunyuan-t1-20250711 Tencent 1387
#163 mistral-medium-2505 Mistral AI 1387
#164 qwen3-coder-480b-a35b-instruct Alibaba 1387
#165 mimo-v2-flash (thinking) Xiaomi 1386
#166 minimax-m2.1-preview MiniMax 1384
#167 hunyuan-turbos-20250416 Tencent 1383
#168 gpt-4.1-mini-2025-04-14 OpenAI 1382
#169 qwen3-30b-a3b-instruct-2507 Alibaba 1382
#170 gemini-2.5-flash-lite-preview-09-2025-no-thinking Google 1380
#171 trinity-large-preview Other 1379
#172 glm-4.6v Z.ai 1378
#173 solar-pro4 upstage 1377
#174 qwen3-235b-a22b Alibaba 1375
#175 gemini-2.5-flash-lite-preview-06-17-thinking Google 1375
#176 qwen2.5-max Alibaba 1374
#177 claude-3-5-sonnet-20241022 Anthropic 1374
#178 glm-4.5-air Z.ai 1373
#179 claude-3-7-sonnet-20250219 Anthropic 1372
#180 trinity-large-thinking Other 1369
#181 qwen3-next-80b-a3b-thinking Alibaba 1369
#182 glm-4.7-flash Z.ai 1367
#183 amazon-nova-experimental-chat-11-10 Amazon 1365
#184 gemma-3-27b-it Google 1365
#185 minimax-m1 MiniMax 1364
#186 grok-3-mini-high xAI 1364
#187 o3-mini-high OpenAI 1363
#188 nvidia-nemotron-3-super-120b-a12b NVIDIA 1361
#189 gemini-2.0-flash-001 Google 1360
#190 deepseek-v3 DeepSeek 1358
#191 grok-3-mini-beta xAI 1358
#192 mistral-small-2506 Mistral AI 1357
#193 intellect-3 Other 1356
#194 command-a-03-2025 Cohere 1354
#195 gemini-2.0-flash-lite-preview-02-05 Google 1353
#196 glm-4.5v Z.ai 1353
#197 gpt-oss-120b OpenAI 1352
#198 nvidia-nemotron-3.5-lightning-30b-a3b-nvfp4 NVIDIA 1352
#199 gemini-1.5-pro-002 Google 1351
#200 amazon-nova-experimental-chat-10-20 Amazon 1350
#201 step-3 StepFun 1350
#202 hunyuan-turbos-20250226 Tencent 1349
#203 o3-mini OpenAI 1348
#204 llama-3.1-nemotron-ultra-253b-v1 NVIDIA 1347
#205 qwen3-32b Alibaba 1347
#206 amazon-nova-experimental-chat-10-09 Amazon 1347
#207 mercury-2 inception-ai 1346
#208 qwen-plus-0125 Alibaba 1346
#209 gpt-4o-2024-05-13 OpenAI 1346
#210 minimax-m2 MiniMax 1346
#211 ling-flash-2.0 ant-group 1344
#212 nvidia-llama-3.3-nemotron-super-49b-v1.5 NVIDIA 1343
#213 claude-3-5-sonnet-20240620 Anthropic 1343
#214 glm-4-plus-0111 Z.ai 1343
#215 gemma-3-12b-it Google 1342
#216 granite-4.2-30b IBM 1341
#217 hunyuan-turbo-0110 Tencent 1341
#218 gpt-5-nano-high OpenAI 1337
#219 o1-mini OpenAI 1337
#220 nova-2-lite Amazon 1336
#221 qwq-32b Alibaba 1336
#222 gemini-advanced-0514 Google 1336
#223 grok-2-2024-08-13 xAI 1335
#224 gpt-4o-2024-08-06 OpenAI 1335
#225 llama-3.1-405b-instruct-bf16 Meta 1335
#226 step-2-16k-exp-202412 StepFun 1333
#227 llama-3.1-405b-instruct-fp8 Meta 1333
#228 olmo-3.1-32b-instruct allenai 1330
#229 yi-lightning Other 1328
#230 llama-3.3-nemotron-49b-super-v1 NVIDIA 1328
#231 molmo-2-8b allenai 1328
#232 qwen3-30b-a3b Alibaba 1327
#233 llama-4-maverick-17b-128e-instruct Meta 1327
#234 hunyuan-large-2025-02-10 Tencent 1326
#235 gpt-4-turbo-2024-04-09 OpenAI 1324
#236 claude-3-5-haiku-20241022 Anthropic 1324
#237 gemini-1.5-pro-001 Google 1324
#238 deepseek-v2.5-1210 DeepSeek 1323
#239 gpt-4.1-nano-2025-04-14 OpenAI 1322
#240 claude-3-opus-20240229 Anthropic 1322
#241 llama-4-scout-17b-16e-instruct Meta 1321
#242 ring-flash-2.0 ant-group 1321
#243 step-1o-turbo-202506 StepFun 1320
#244 glm-4-plus Z.ai 1319
#245 qwen-max-0919 Alibaba 1318
#246 gpt-4o-mini-2024-07-18 OpenAI 1317
#247 llama-3.3-70b-instruct Meta 1317
#248 gemma-3n-e4b-it Google 1317
#249 gpt-oss-20b OpenAI 1317
#250 qwen2.5-plus-1127 Alibaba 1315
#251 nvidia-nemotron-3-nano-30b-a3b-bf16 NVIDIA 1314
#252 mistral-large-2407 Mistral AI 1314
#253 athene-v2-chat Other 1314
#254 gpt-4-0125-preview OpenAI 1313
#255 gpt-4-1106-preview OpenAI 1312
#256 hunyuan-standard-2025-02-10 Tencent 1311
#257 gemini-1.5-flash-002 Google 1309
#258 grok-2-mini-2024-08-13 xAI 1308
#259 mercury inception-ai 1308
#260 deepseek-v2.5 DeepSeek 1307
#261 olmo-3-32b-think Allen AI 1307
#262 athene-70b-0725 Other 1306
#263 granite-4.1-8b ibm 1306
#264 mistral-large-2411 Mistral AI 1305
#265 magistral-medium-2506 Mistral AI 1304
#266 gemma-3-4b-it Google 1303
#267 mistral-small-3.1-24b-instruct-2503 Mistral AI 1303
#268 qwen2.5-72b-instruct Alibaba 1303
#269 llama-3.1-nemotron-70b-instruct NVIDIA 1299
#270 granite-4.2-3b IBM 1295
#271 hunyuan-large-vision Tencent 1294
#272 llama-3.1-70b-instruct Meta 1293
#273 amazon-nova-pro-v1.0 Amazon 1290
#274 jamba-1.5-large Other 1289
#275 gemma-2-27b-it Google 1289
#276 granite-4.2-8b IBM 1288
#277 reka-core-20240904 Other 1288
#278 gpt-4-0314 OpenAI 1287
#279 gemini-1.5-flash-001 Google 1286
#280 llama-3.1-nemotron-51b-instruct NVIDIA 1286
#281 llama-3.1-tulu-3-70b Meta 1286
#282 olmo-3.1-32b-think Allen AI 1286
#283 ibm-granite-h-small ibm 1285
#284 claude-3-sonnet-20240229 Anthropic 1281
#285 gemma-2-9b-it-simpo Google 1280
#286 nemotron-4-340b-instruct NVIDIA 1277
#287 llama-3-70b-instruct Meta 1276
#288 command-r-plus-08-2024 Cohere 1276
#289 gpt-4-0613 OpenAI 1276
#290 mistral-small-24b-instruct-2501 Mistral AI 1274
#291 glm-4-0520 Z.ai 1273
#292 reka-flash-20240904 Other 1272
#293 qwen2.5-coder-32b-instruct Alibaba 1270
#294 c4ai-aya-expanse-32b Cohere 1267
#295 gemma-2-9b-it Google 1267
#296 deepseek-coder-v2 DeepSeek 1265
#297 qwen2-72b-instruct Alibaba 1261
#298 command-r-plus Cohere 1261
#299 claude-3-haiku-20240307 Anthropic 1261
#300 amazon-nova-lite-v1.0 Amazon 1260
#301 gemini-1.5-flash-8b-001 Google 1259
#302 phi-4 Microsoft 1256
#303 olmo-2-0325-32b-instruct allenai 1251
#304 command-r-08-2024 Cohere 1250
#305 mistral-large-2402 Mistral AI 1242
#306 amazon-nova-micro-v1.0 Amazon 1240
#307 jamba-1.5-mini Other 1239
#308 ministral-8b-2410 Mistral AI 1237
#309 gemini-pro-dev-api Google 1236
#310 qwen1.5-110b-chat Alibaba 1234
#311 hunyuan-standard-256k Tencent 1233
#312 reka-flash-21b-20240226-online Other 1233
#313 qwen1.5-72b-chat Alibaba 1233
#314 mixtral-8x22b-instruct-v0.1 Mistral AI 1229
#315 command-r Cohere 1226
#316 reka-flash-21b-20240226 Other 1226
#317 gpt-3.5-turbo-0125 OpenAI 1225
#318 llama-3-8b-instruct Meta 1223
#319 gemini-pro Google 1223
#320 c4ai-aya-expanse-8b Cohere 1223
#321 mistral-medium Mistral AI 1222
#322 llama-3.1-tulu-3-8b Meta 1220
#323 yi-1.5-34b-chat Other 1212
#324 zephyr-orpo-141b-A35b-v0.1 Other 1212
#325 llama-3.1-8b-instruct Meta 1211
#326 granite-3.1-8b-instruct ibm 1208
#327 gpt-3.5-turbo-1106 OpenAI 1203
#328 qwen1.5-32b-chat Alibaba 1203
#329 gemma-2-2b-it Google 1200
#330 phi-3-medium-4k-instruct Microsoft 1197
#331 mixtral-8x7b-instruct-v0.1 Mistral AI 1197
#332 dbrx-instruct-preview Other 1195
#333 qwen1.5-14b-chat Alibaba 1191
#334 internlm2_5-20b-chat Other 1190
#335 deepseek-llm-67b-chat DeepSeek 1184
#336 wizardlm-70b Microsoft 1184
#337 yi-34b-chat Other 1183
#338 granite-3.0-8b-instruct ibm 1183
#339 openchat-3.5 Other 1182
#340 openchat-3.5-0106 Other 1182
#341 gemma-1.1-7b-it Google 1182
#342 snowflake-arctic-instruct Other 1179
#343 granite-3.1-2b-instruct ibm 1178
#344 tulu-2-dpo-70b Other 1177
#345 openhermes-2.5-mistral-7b Other 1175
#346 vicuna-33b Other 1172
#347 phi-3-small-8k-instruct Microsoft 1171
#348 starling-lm-7b-beta Other 1171
#349 llama-2-70b-chat Meta 1170
#350 starling-lm-7b-alpha Other 1167
#351 llama-3.2-3b-instruct Meta 1166
#352 nous-hermes-2-mixtral-8x7b-dpo Other 1164
#353 granite-3.0-2b-instruct ibm 1156
#354 llama2-70b-steerlm-chat NVIDIA 1154
#355 qwq-32b-preview Alibaba 1154
#356 solar-10.7b-instruct-v1.0 Other 1152
#357 dolphin-2.2.1-mistral-7b Other 1152
#358 mpt-30b-chat Other 1150
#359 wizardlm-13b Microsoft 1149
#360 mistral-7b-instruct-v0.2 Mistral AI 1149
#361 falcon-180b-chat Other 1147
#362 qwen1.5-7b-chat Alibaba 1143
#363 phi-3-mini-4k-instruct-june-2024 Microsoft 1143
#364 llama-2-13b-chat Meta 1141
#365 vicuna-13b Other 1141
#366 qwen-14b-chat Alibaba 1139
#367 palm-2 Google 1138
#368 gemma-7b-it Google 1137
#369 codellama-34b-instruct Meta 1136
#370 zephyr-7b-beta Other 1130
#371 phi-3-mini-128k-instruct Microsoft 1129
#372 phi-3-mini-4k-instruct Microsoft 1128
#373 guanaco-33b Other 1127
#374 zephyr-7b-alpha Other 1126
#375 stripedhyena-nous-7b Other 1121
#376 codellama-70b-instruct Meta 1119
#377 gemma-1.1-2b-it Google 1116
#378 vicuna-7b Other 1115
#379 smollm2-1.7b-instruct Other 1114
#380 llama-3.2-1b-instruct Meta 1111
#381 mistral-7b-instruct Mistral AI 1110
#382 llama-2-7b-chat Meta 1107
#383 gemma-2b-it Google 1093
#384 qwen1.5-4b-chat Alibaba 1090
#385 olmo-7b-instruct allenai 1073
#386 koala-13b Other 1070
#387 alpaca-13b Other 1069
#388 gpt4all-13b-snoozy OpenAI 1067
#389 mpt-7b-chat Other 1063
#390 chatglm3-6b Z.ai 1056
#391 RWKV-4-Raven-14B Other 1042
#392 chatglm2-6b Z.ai 1024
#393 oasst-pythia-12b Other 1023
#394 chatglm-6b Other 995
#395 fastchat-t5-3b Other 992
#396 dolly-v2-12b Other 982
#397 llama-13b Meta 974
#398 stablelm-tuned-alpha-7b Stability AI 953

Arena WebDev

Role: Interactive Web Application Generation Blind Preference

Evaluates single-prompt interactive web application generation, judged blindly by human users on aesthetics and functionality.

121 models listed
Rank Model Provider Benchmark Score
#1 qwen3.8-max-0902 Alibaba 1691
#2 claude-opus-5-max Anthropic 1688
#3 kimi-k3-max Moonshot AI 1674
#4 qwen3.8-max Alibaba 1669
#5 claude-opus-5-high Anthropic 1661
#6 hy4-preview Tencent 1629
#7 grok-4.6-high xAI 1629
#8 claude-fable-5 Anthropic 1628
#9 qwen3.8-flash-next Alibaba 1620
#10 gpt-5.6-sol-xhigh (codex-harness) OpenAI 1616
#11 glm-5.3-max Z.ai 1608
#12 glm-5.3-flash Z.ai 1604
#13 qwen3.8-27b Alibaba 1599
#14 gemini-3.7-flash-high Google 1587
#15 glm-5.2-max Z.ai 1585
#16 deepseek-v4-pro-high-20260813 DeepSeek 1584
#17 deepseek-v4-flash-high DeepSeek 1581
#18 claude-opus-4-8-high Anthropic 1563
#19 claude-opus-4-7 Anthropic 1557
#20 claude-opus-4-7-high Anthropic 1556
#21 grok-4.5 xAI 1555
#22 claude-opus-4-6-high Anthropic 1546
#23 claude-opus-4-8 Anthropic 1540
#24 muse-spark-1.1 Meta 1540
#25 gemini-3.6-flash-high Google 1538
#26 claude-sonnet-5-high Anthropic 1537
#27 claude-opus-4-6 Anthropic 1537
#28 muse-spark-1.2 (xHigh) Meta 1534
#29 seed-2.1-pro-preview ByteDance 1522
#30 claude-sonnet-4-6 Anthropic 1522
#31 gpt-5.6-luna-xhigh (codex-harness) OpenAI 1519
#32 gpt-5.6-terra-xhigh (codex-harness) OpenAI 1518
#33 qwen3.7-max-20260517 Alibaba 1517
#34 hy3 Tencent 1511
#35 gpt-5.5-xhigh (codex-harness) OpenAI 1510
#36 kimi-k2.6 Moonshot AI 1509
#37 glm-5.1 Z.ai 1509
#38 gemini-3.5-flash-high Google 1501
#39 claude-opus-4-5-20251101-high-32k Anthropic 1495
#40 gemini-3.5-flash-medium Google 1492
#41 minimax-m3 MiniMax 1487
#42 gpt-5.5-high (codex-harness) OpenAI 1486
#43 qwen3.6-max-preview Alibaba 1479
#44 mimo-v2.5-pro Xiaomi 1476
#45 kimi-k2.7-code Moonshot AI 1473
#46 claude-opus-4-5-20251101 Anthropic 1468
#47 deepseek-v4-pro-high-preview DeepSeek 1464
#48 gpt-5.4-high (codex-harness) OpenAI 1463
#49 qwen3.6-plus Alibaba 1460
#50 gpt-5.5 (codex-harness) OpenAI 1457
#51 gemini-3.5-flash-lite Google 1449
#52 gemini-3.1-pro-preview Google 1446
#53 deepseek-v4-pro DeepSeek 1445
#54 gpt-5.4-medium (codex-harness) OpenAI 1442
#55 gemini-3-pro Google 1438
#56 mimo-v2.5 Xiaomi 1438
#57 gemini-3-flash Google 1438
#58 kimi-k2.5-thinking Moonshot AI 1436
#59 glm-5 Z.ai 1436
#60 glm-4.7 Z.ai 1435
#61 mimo-v2-pro Xiaomi 1434
#62 deepseek-v4-flash-high-preview DeepSeek 1431
#63 gpt-5-medium OpenAI 1419
#64 gpt-5.2 OpenAI 1416
#65 gpt-5.3-codex (codex-harness) OpenAI 1408
#66 inkling Other 1408
#67 kimi-k2.5-instant Moonshot AI 1405
#68 Inkling Small Thinking Machines 1403
#69 glm-5v-turbo Z.ai 1400
#70 minimax-m2.7 MiniMax 1399
#71 qwen3.5-397b-a17b Alibaba 1398
#72 gpt-5.4-mini-high OpenAI 1397
#73 claude-sonnet-4-5-20250929-high-32k Anthropic 1393
#74 gpt-5.1-medium OpenAI 1391
#75 claude-opus-4-1-20250805 Anthropic 1389
#76 gpt-5.4 OpenAI 1389
#77 minimax-m2.1-preview MiniMax 1387
#78 claude-sonnet-4-5-20250929 Anthropic 1386
#79 minimax-m2.5 MiniMax 1384
#80 gemini-3-flash (thinking-minimal) Google 1383
#81 grok-4.20-beta-0309-reasoning xAI 1373
#82 solar-pro4 upstage 1370
#84 gemma-4-31b Google 1363
#85 gemma-4-26b-a4b Google 1362
#86 deepseek-v3.2-thinking DeepSeek 1361
#87 muse-glimmer Meta 1359
#88 qwen3.5-122b-a10b Alibaba 1358
#89 qwen3.5-27b Alibaba 1357
#90 hunyuan-hy3-preview Tencent 1356
#91 grok-4.3 xAI 1356
#92 laguna-m.1 poolside 1347
#93 gpt-5.1 OpenAI 1341
#94 glm-4.6 Z.ai 1341
#95 gpt-5.2-codex OpenAI 1339
#96 gpt-5.1-codex OpenAI 1336
#97 mimo-v2-flash (non-thinking) Xiaomi 1331
#98 claude-haiku-4-5-20251001 Anthropic 1329
#99 deepseek-v3.2 DeepSeek 1325
#100 kimi-k2-thinking-turbo Moonshot AI 1323
#101 laguna-xs.2 poolside 1302
#102 minimax-m2 MiniMax 1297
#103 mimo-v2-flash (thinking) Xiaomi 1292
#104 qwen3-coder-480b-a35b-instruct Alibaba 1274
#105 deepseek-v3.2-exp DeepSeek 1272
#106 mistral-medium-3.5 Mistral AI 1265
#107 KAT-Coder-Pro-V1 Other 1254
#108 gemini-3.1-flash-lite-preview Google 1254
#109 qwen3.5-35b-a3b Alibaba 1250
#110 gpt-5.1-codex-mini OpenAI 1243
#111 grok-4-1-fast-reasoning xAI 1241
#112 qwen3.5-flash Alibaba 1238
#113 trinity-large-thinking Other 1238
#114 mistral-large-3 Mistral AI 1229
#115 gemini-2.5-pro Google 1225
#116 grok-4.1-thinking xAI 1211
#117 devstral-2 Mistral AI 1194
#118 granite-4.1-8b ibm 1192
#119 mercury-2 inception-ai 1166
#120 grok-code-fast-1 xAI 1165
#121 grok-4-fast-reasoning xAI 1162
#122 devstral-medium-2507 Mistral AI 1080

Mercor APEX-Agents

Role: Real-World Complex Long-Horizon Agent Benchmark

Multi-hour complex real-world workflows designed by domain experts to evaluate autonomous agent capability and reliability.

73 models listed
Rank Model Provider Benchmark Score
#1 gpt-6-astra OpenAI 62.4
#2 claude-fable-5.1 Anthropic 62.0
#3 claude-opus-5 Anthropic 60.6
#4 claude-fable-5.1-high Anthropic 60.0
#5 claude-fable-5 Anthropic 59.2
#6 muse-spark-1-1 Meta 58.1
#7 grok-4-6 xAI 57.5
#8 gpt-5-6-sol-max OpenAI 56.7
#9 gpt-5-6-sol-max-pro OpenAI 56.4
#10 claude-opus-4-8 Anthropic 56.2
#11 gpt-5.5-xhigh OpenAI 55.5
#12 kimi-k3 Moonshot AI 55.4
#13 gpt-5-6-sol-xhigh OpenAI 54.3
#14 zai-org/GLM-5.2-FP8 Z.ai 52.2
#15 deepseek-v4-flash DeepSeek 51.6
#16 responses/gpt-5.4 OpenAI 51.3
#17 claude-opus-4-7 Anthropic 50.1
#18 claude-opus-4-6-high Anthropic 48.7
#18 gemini-3.1-pro-preview-high Google 48.7
#20 claude-sonnet-5 Anthropic 48.5
#21 gpt-5.2-xhigh OpenAI 47.8
#22 grok-4-5 xAI 47.1
#23 gemini-3-pro-preview-high Google 46.7
#24 gpt-5.3-codex-high OpenAI 44.6
#25 gpt-5.2-codex-high OpenAI 42.5
#26 kimi-k2-7-code Moonshot AI 41.9
#27 iter-39 Applied Compute 40.1
#28 claude-opus-4-5-high Anthropic 37.1
#29 zai-org/GLM-4.7 Z.ai 21.2
#1 claude-fable-5 Anthropic 60.9
#2 claude-opus-4-8 Anthropic 59.4
#3 gpt-5.5-xhigh OpenAI 53.9
#4 grok-4-5 xAI 50.9
#5 claude-opus-4-7 Anthropic 50.6
#6 claude-opus-4-6-max Anthropic 48.4
#6 gpt-5.2-xhigh OpenAI 48.4
#8 gemini-3.1-pro-preview-high Google 48.2
#9 gpt-5.3-codex-high OpenAI 46.9
#10 claude-opus-4-6-high Anthropic 45.6
#11 gpt-5.2-codex-high OpenAI 42.2
#12 claude-sonnet-4-6-high Anthropic 40.7
#13 gemini-3-flash-preview-high Google 39.5
#14 gpt-5.2-high OpenAI 38.7
#15 responses/galapagos-mini-alpha-xhigh OpenAI 37.5
#16 gpt-5.1-codex-high OpenAI 34.9
#17 claude-opus-4-5-high Anthropic 34.8
#17 gpt-5-codex-high OpenAI 34.8
#19 gemini-3-pro-preview-high Google 34.1
#20 kimi-k2.6 Moonshot AI 33.2
#21 gpt-5-high OpenAI 33.0
#22 gpt-5.1-high OpenAI 31.5
#23 o3-high OpenAI 31.4
#24 zai-org/GLM-5 Z.ai 30.8
#25 grok-4 xAI 30.3
#26 moonshotai/Kimi-K2.5 Moonshot AI 29.2
#27 Qwen/Qwen3.5-397B-A17B-high Alibaba 27.7
#28 nemotron-3-ultra-550b NVIDIA 26.2
#29 responses/galapagos-nano-alpha-xhigh OpenAI 25.5
#30 gemini-3.1-flash-lite-preview-high Google 25.0
#31 grok-4-1-fast-reasoning xAI 24.8
#32 claude-sonnet-4-20250514 Anthropic 23.0
#33 claude-haiku-4-5-high Anthropic 21.4
#34 deepseek-ai/DeepSeek-V3.2 DeepSeek 18.8
#35 MiniMax-M2.5 MiniMax 18.7
#36 gemini-2.5-pro-high Google 17.0
#37 openai/gpt-oss-120b OpenAI 14.5
#38 zai-org/GLM-4.6 Z.ai 11.8
#39 moonshotai/Kimi-K2-Thinking Moonshot AI 11.5
#40 zai-org/GLM-4.7 Z.ai 8.4
#41 grok-3 xAI 7.3
#42 gemini-2.5-flash-high Google 6.4
#43 o1-high OpenAI 5.5
#44 gpt-4o OpenAI 5.4

Vals Finance Agent

Role: Automated Real-World Financial Analysis Workflows

Covers financial report modeling, statement analysis, valuation, and investment memo writing to measure agent office utility.

56 models listed
Rank Model Provider Benchmark Score
#1 google/gemini-3.8-flash Google 61.4
#2 meta/muse_spark_1_2 Meta 60.6
#3 google/gemini-3.7-flash Google 59.0
#4 anthropic/claude-fable-5-1 Anthropic 58.9
#5 anthropic/claude-opus-5 Anthropic 58.6
#6 google/gemini-3.5-flash Google 57.9
#7 zai/glm-5.3-flash Z.ai 57.9
#8 meta/muse_spark_1_1 Meta 57.2
#9 anthropic/claude-fable-5 Anthropic 56.3
#10 google/gemini-3.6-flash Google 56.3
#11 zai/glm-5.3 Z.ai 55.8
#12 openai/gpt-5.6-luna OpenAI 55.0
#13 openai/gpt-5.6-terra OpenAI 54.4
#14 kimi/kimi-k3 Moonshot AI 54.4
#15 anthropic/claude-opus-4-8 Anthropic 53.9
#16 anthropic/claude-sonnet-5 Anthropic 53.9
#17 openai/gpt-5.6-sol OpenAI 53.8
#18 grok/grok-4.6 xAI 53.7
#19 openai/gpt-6-astra OpenAI 53.5
#20 openai/gpt-5.5 OpenAI 51.8
#21 anthropic/claude-opus-4-7 Anthropic 51.5
#22 anthropic/claude-sonnet-4-6 Anthropic 51.0
#23 alibaba/qwen3.8-max Alibaba 50.6
#24 deepseek/deepseek-v4-pro-0813 DeepSeek 50.4
#25 zai/glm-5.2 Z.ai 49.7
#26 deepseek/deepseek-v4-flash-0731 DeepSeek 49.5
#27 alibaba/qwen3.8-27b Alibaba 48.6
#28 grok/grok-4.5 xAI 48.3
#29 minimax/MiniMax-M3 MiniMax 48.3
#30 alibaba/qwen3.7-max Alibaba 47.8
#31 google/gemini-3.5-flash-lite Google 47.4
#32 thinkingmachines/inkling Other 46.6
#33 openai/gpt-5.4-mini-2026-03-17 OpenAI 45.4
#34 kimi/kimi-k2.6 Moonshot AI 44.9
#35 zai/glm-5.1 Z.ai 44.8
#36 deepseek/deepseek-v4-pro DeepSeek 44.1
#37 google/gemini-3.1-pro-preview Google 43.0
#38 google/gemini-3-flash-preview Google 42.6
#39 xiaomi/mimo-v2.5-pro Xiaomi 41.5
#40 thinkingmachines/inkling-small Thinking Machines 41.3
#41 alibaba/qwen3.6-plus Alibaba 40.8
#42 alibaba/qwen3.7-plus Alibaba 38.2
#43 openai/gpt-5.4-nano-2026-03-17 OpenAI 38.2
#44 grok/grok-4.3 xAI 37.7
#45 nvidia/nemotron-3-ultra-550b-a55b NVIDIA 37.7
#46 xiaomi/mimo-v2.5 Xiaomi 36.7
#47 kimi/kimi-k2.5-thinking Moonshot AI 35.8
#48 mistralai/mistral-medium-3.5 Mistral AI 32.1
#49 anthropic/claude-haiku-4-5-20251001-thinking Anthropic 31.0
#50 ant/ling-3.0-flash-2607 Ant 30.3
#51 google/gemini-3.1-flash-lite-preview Google 30.0
#52 grok/grok-4.20-0309-reasoning xAI 28.5
#53 minimax/MiniMax-M2.7 MiniMax 27.9
#54 poolside/laguna-m.1 poolside 25.0
#55 fireworks/nemotron-lightning-3p5-30b-a3b NVIDIA 18.5
#56 poolside/laguna-xs.2 poolside 15.6

DeepSWE v1.1

Role: Unified Software Engineering Agent Resolution Benchmark

Measures end-to-end bug localization, test authoring, and patch generation across real industrial open-source repositories.

70 models listed
Rank Model Provider Benchmark Score
#1 gpt-6-astra OpenAI 74.1%
#2 gemini-3-8-flash Google 73.8%
#3 claude-opus-5 Anthropic 73.6%
#4 gpt-6-astra OpenAI 73.2%
#4 gpt-6-astra OpenAI 73.2%
#6 claude-opus-5 Anthropic 73.2%
#7 claude-opus-5 Anthropic 72.8%
#8 gpt-6-astra OpenAI 72.8%
#9 gpt-5-6-sol OpenAI 72.7%
#10 gemini-3-8-flash Google 71.0%
#11 gpt-5-6-sol OpenAI 70.7%
#12 claude-fable-5 Anthropic 69.9%
#13 claude-fable-5 Anthropic 69.7%
#14 gpt-5-6-terra OpenAI 69.6%
#15 gpt-5-6-sol OpenAI 69.4%
#16 glm-5-3 Z.ai 69.0%
#17 claude-opus-5 Anthropic 68.9%
#18 claude-fable-5 Anthropic 68.6%
#19 kimi-k3 Moonshot AI 68.5%
#20 grok-4-6 xAI 67.5%
#21 gpt-5-6-luna OpenAI 67.2%
#22 gpt-6-astra OpenAI 67.0%
#22 gpt-5-5 OpenAI 67.0%
#24 grok-4-6 xAI 66.7%
#25 gemini-3-7-flash Google 65.5%
#26 claude-fable-5 Anthropic 65.4%
#27 gemini-3-7-flash Google 65.3%
#28 grok-4-6 xAI 65.2%
#29 gpt-5-5 OpenAI 64.4%
#30 glm-5-3-flash Z.ai 63.4%
#31 deepseek-v4-pro DeepSeek 62.8%
#32 gpt-5-6-sol OpenAI 61.1%
#33 gpt-5-6-terra OpenAI 60.2%
#34 claude-fable-5 Anthropic 59.6%
#35 claude-opus-4-8 Anthropic 59.0%
#36 claude-opus-5 Anthropic 58.1%
#37 qwen3-8-max Alibaba 57.5%
#38 gpt-5-6-luna OpenAI 56.9%
#39 muse-spark-1-2 Meta 54.9%
#40 claude-opus-4-8 Anthropic 54.4%
#41 gpt-5-5 OpenAI 54.0%
#42 claude-sonnet-5 Anthropic 53.8%
#43 gpt-5-6-terra OpenAI 53.8%
#43 gemini-3-7-flash Google 53.8%
#43 grok-4-5 xAI 53.8%
#46 deepseek-v4-flash DeepSeek 53.3%
#46 muse-spark-1-1 Meta 53.3%
#48 claude-opus-4-8 Anthropic 51.8%
#48 gpt-5-4 OpenAI 51.8%
#50 claude-sonnet-5 Anthropic 49.7%
#51 claude-opus-4-8 Anthropic 48.7%
#52 claude-sonnet-5 Anthropic 48.2%
#53 gemini-3-6-flash Google 46.7%
#54 gpt-5-6-sol OpenAI 45.4%
#55 gpt-5-6-luna OpenAI 44.2%
#56 glm-5-2 Z.ai 43.8%
#57 grok-4-6 xAI 41.6%
#58 claude-opus-4-8 Anthropic 40.8%
#59 claude-sonnet-5 Anthropic 39.8%
#60 glm-5-2 Z.ai 36.3%
#61 gemini-3-5-flash Google 36.1%
#62 gpt-5-6-terra OpenAI 35.1%
#63 kimi-k2-7-code Moonshot AI 30.5%
#64 claude-sonnet-5 Anthropic 30.5%
#65 claude-sonnet-4-6 Anthropic 29.9%
#66 gpt-5-5 OpenAI 27.0%
#67 gpt-5-6-terra OpenAI 24.1%
#68 gemini-3-1-pro-preview Google 11.7%
#69 gpt-5-6-luna OpenAI 11.3%
#70 gpt-5-6-luna OpenAI 1.5%

TapTap Maker Benchmark

Role: Real Game Engine Lua Execution & Interaction Benchmark

Evaluates complete gameplay Lua code generation executed directly inside a game engine, strictly verifying game logic and state.

29 models listed
Rank Model Provider Benchmark Score
#1 claude-fable-5 Anthropic 89.0%
#2 claude-opus-5 Anthropic 88.9%
#3 grok-4.6 xAI 87.3%
#4 gpt-5.6-sol OpenAI 86.5%
#5 claude-opus-5 Anthropic 86.5%
#6 gemini-3.7-flash Google 84.1%
#7 grok-4.6 xAI 84.1%
#8 glm-5.3 Z.ai 83.6%
#9 claude-opus-4-8 Anthropic 82.8%
#10 qwen3.8-max Alibaba 82.5%
#11 gpt-5.6-terra OpenAI 81.8%
#12 qwen3.8-flash Alibaba 81.5%
#13 glm-5.3-flash Z.ai 81.5%
#14 kimi-k3 Moonshot AI 79.7%
#15 x-ai/grok-4.5 xAI 78.3%
#16 gpt-5.6-luna OpenAI 77.8%
#17 deepseek-v4-pro DeepSeek 77.8%
#18 gemini-3.6-flash Google 76.2%
#19 claude-opus-4-6 Anthropic 76.2%
#20 deepseek-v4-flash DeepSeek 74.6%
#21 glm-5.2 Z.ai 74.3%
#22 claude-sonnet-5 Anthropic 73.3%
#23 hy3 Tencent 73.0%
#24 doubao-seed-evolving ByteDance 72.8%
#25 qwen3.8-27b Alibaba 68.3%
#26 gemini-3.1-pro-preview Google 64.7%
#27 gemini-3.5-flash Google 63.9%
#28 MiniMax/MiniMax-M3 MiniMax 60.1%
#29 claude-haiku-4-5 Anthropic 43.6%