| 1 | MiniMax M3 | MiniMax | Open weights | 82.9% | |
| 2 | Nemotron 3 Ultra | NVIDIA | Open weights | 81.4% | |
| 3 | Grok 4.3 | xAI | Proprietary | 81.3% | |
| 4 | Qwen3.7 Max | Alibaba · Closed | 80.5% | | |
| 5 | MiMo-V2.5-Pro | Xiaomi · Closed | 79.9% | | |
| 6 | Qwen3.7 Plus | Alibaba · Closed | 78.0% | | |
| 7 | GPT-5.2-Codex | OpenAI · Closed | 77.6% | | |
| 8 | Gemini 3.1 Pro | Google · Closed | 77.1% | | |
| 9 | Qwen 3.6 Max (preview) | Alibaba · Closed | 76.6% | | |
| 10 | DeepSeek V4 Pro 0813 | DeepSeek · Closed | 76.5% | | |
| 11 | Gemini 3.5 Flash | Google · Closed | 76.3% | | |
| 12 | GLM-5.1 | Z.AI · Open weight | 76.3% | | |
| 13 | Kimi K2.6 | Moonshot AI · Open weight | 76.0% | | |
| 14 | GPT-5.5 | OpenAI · Closed | 75.9% | | |
| 15 | Muse Spark | Meta · Closed | 75.9% | | |
| 16 | GPT-5.4 nano | OpenAI · Closed | 75.9% | | |
| 17 | MiniMax M2.7 | MiniMax · Open weight | 75.7% | | |
| 18 | Qwen3.5-122B-A10B | Alibaba · Open weight | 75.7% | | |
| 19 | Gemma 4 31B | Google · Open weight | 75.6% | | |
| 20 | Qwen3.5-27B | Alibaba · Open weight | 75.6% | | |
| 21 | GPT-5.3 Codex | OpenAI · Closed | 75.4% | | |
| 22 | GPT-5.2 | OpenAI · Closed | 75.4% | | |
| 23 | GPT-5.3-Codex-Spark | OpenAI · Closed | 75.4% | | |
| 24 | GPT-5 mini | OpenAI · Closed | 75.4% | | |
| 25 | Qwen3.6 Plus | Alibaba · Closed | 75.2% | | |
| 26 | GPT-5.4 | OpenAI · Closed | 73.9% | | |
| 27 | Command A+ | Cohere · Open weight | 73.9% | | |
| 28 | Gemma 4 12B | Google · Open weight | 73.5% | | |
| 29 | GLM-5.2 | Z.AI · Open weight | 73.3% | | |
| 30 | GPT-5.4 mini | OpenAI · Closed | 73.3% | | |
| 31 | GLM-5-Turbo | Z.AI · Closed | 73.2% | | |
| 32 | GPT-5 (high) | OpenAI · Closed | 73.1% | | |
| 33 | GPT-5.1 | OpenAI · Closed | 72.9% | | |
| 34 | GPT-5.6 Sol | OpenAI · Closed | 72.7% | | |
| 35 | Qwen3.5-35B-A3B | Alibaba · Open weight | 72.5% | | |
| 36 | Gemma 4 26B A4B | Google · Open weight | 72.4% | | |
| 37 | GLM-5 | Z.AI · Open weight | 72.3% | | |
| 38 | MiniMax M2.5 | MiniMax · Closed | 71.6% | | |
| 39 | Nemotron 3 Super 100B | NVIDIA · Open weight | 71.5% | | |
| 40 | Nemotron 3 Super 120B A12B | NVIDIA · Open weight | 71.5% | | |
| 41 | o3 | OpenAI · Closed | 71.4% | | |
| 43 | GPT-5.6 Terra | OpenAI · Closed | 71.2% | | |
| 44 | Solar Pro 3 | Upstage · Closed | 71.2% | | |
| 45 | Nemotron 3 Nano 30B | NVIDIA · Open weight | 71.1% | | |
| 46 | GPT-5 (medium) | OpenAI · Closed | 70.6% | | |
| 47 | Gemini 3 Pro | Google · Closed | 70.4% | | |
| 48 | o1 | OpenAI · Closed | 70.3% | | |
| 49 | Kimi K2.5 | Moonshot AI · Open weight | 70.2% | | |
| 50 | Kimi K2.5 (Reasoning) | Moonshot AI · Closed | 70.2% | | |
| 51 | GPT-5.1-Codex | OpenAI · Closed | 70.0% | | |
| 52 | GPT-5.1-Codex-Max | OpenAI · Closed | 70.0% | | |
| 53 | Mercury 2 | Inception · Closed | 69.8% | | |
| 54 | GPT-OSS 120B | OpenAI · Open weight | 69.0% | | |
| 55 | Mistral Medium 3.5 128B | Mistral · Open weight | 68.8% | | |
| 56 | MiMo-V2-Pro | Xiaomi · Closed | 68.8% | | |
| 57 | GLM-4.7 | Z.AI · Open weight | 67.9% | | |
| 58 | Qwen3.6-27B | Alibaba · Open weight | 67.6% | | |
| 59 | GPT-5 nano | OpenAI · Closed | 67.6% | | |
| 60 | Step 3.7 Flash | StepFun · Open weight | 67.3% | | |
| 61 | Step 3.5 Flash | StepFun · Open weight | 66.5% | | |
| 62 | GPT-OSS 20B | OpenAI · Open weight | 65.1% | | |
| 63 | K-Exaone | LG AI Research · Closed | 64.7% | | |
| 64 | Qwen3.6-35B-A3B | Alibaba · Open weight | 64.4% | | |
| 65 | Claude Fable 5 | Anthropic · Closed | 63.5% | | |
| 66 | Nemotron 3 Nano Omni 30B A3B | NVIDIA · Open weight | 63.2% | | |
| 67 | Kimi K2.7 Code | Moonshot AI · Open weight | 63.1% | | |
| 68 | Claude Opus 4.8 | Anthropic · Closed | 62.2% | | |
| 69 | GLM-5V-Turbo | Z.AI · Closed | 61.1% | | |
| 70 | GLM-4.7-Flash | Z.AI · Open weight | 60.8% | | |
| 71 | Claude Opus 4.7 (Adaptive) | Anthropic · Closed | 58.6% | | |
| 72 | Claude Opus 4.5 Thinking | Anthropic · Closed | 58.0% | | |
| 73 | North Mini Code | Cohere · Open weight | 57.6% | | |
| 74 | Ling 2.6 Flash | InclusionAI · Open weight | 57.4% | | |
| 75 | Trinity-Large-Thinking | Arcee AI · Open weight | 56.3% | | |
| 76 | Trinity-Large-Preview | Arcee AI · Open weight | 56.3% | | |
| 77 | LFM2.5-8B-A1B | LiquidAI · Open weight | 55.6% | | |
| 78 | Claude 4.1 Opus Thinking | Anthropic · Closed | 55.4% | | |
| 79 | Gemini 3 Flash | Google · Closed | 55.1% | | |
| 80 | Grok 4 | xAI · Closed | 53.7% | | |
| 81 | MiMo-V2-Omni | Xiaomi · Closed | 53.5% | | |
| 82 | Claude Opus 4.6 (Adaptive) | Anthropic · Closed | 53.1% | | |
| 83 | Grok 4.1 Fast (Reasoning) | xAI · Closed | 52.7% | | |
| 84 | Qwen3.5 397B | Alibaba · Open weight | 51.6% | | |
| 85 | Qwen3.5 397B (Reasoning) | Alibaba · Open weight | 51.6% | | |
| 86 | Grok 4 Fast (Reasoning) | xAI · Closed | 50.5% | | |
| 87 | DeepSeek V3.2 | DeepSeek · Open weight | 49.0% | | |
| 88 | Gemini 2.5 Pro | Google · Closed | 48.7% | | |
| 89 | Mistral Small 4 | Mistral · Open weight | 48.2% | | |
| 90 | Mistral Small 4 (Reasoning) | Mistral · Open weight | 48.2% | | |
| 91 | Ultravox v0.6 Llama 3.3 70B | Fixie AI · Open weight | 47.1% | | |
| 92 | LFM2-24B-A2B | LiquidAI · Closed | 45.9% | | |
| 93 | Claude 4 Sonnet | Anthropic · Closed | 45.4% | | |
| 94 | Claude Opus 4.6 | Anthropic · Closed | 44.6% | | |
| 95 | Gemma 4 E4B | Google · Open weight | 44.2% | | |
| 96 | Qwen3 Max | Alibaba · Closed | 44.1% | | |
| 97 | LFM2.5-1.2B-Instruct | LiquidAI · Closed | 43.8% | | |
| 98 | Claude Opus 4.7 | Anthropic · Closed | 43.6% | | |
| 99 | Qwen3-Omni-30B-A3B-Thinking | Alibaba · Open weight | 43.4% | | |
| 100 | Claude Opus 4.5 | Anthropic · Closed | 43.0% | | |
| 101 | Llama 4 Maverick | Meta · Open weight | 43.0% | | |
| 102 | GPT-4.1 | OpenAI · Closed | 43.0% | | |
| 103 | MiniMax M1 80k | MiniMax · Closed | 41.8% | | |
| 104 | LFM2.5-1.2B-Thinking | LiquidAI · Closed | 41.8% | | |
| 105 | DeepSeek V3.1 (Reasoning) | DeepSeek · Open weight | 41.5% | | |
| 106 | Kimi K2 | Moonshot AI · Closed | 41.5% | | |
| 107 | Grok Code Fast 1 | xAI · Closed | 41.4% | | |
| 108 | Claude Sonnet 4.6 | Anthropic · Closed | 41.2% | | |
| 109 | MiMo-V2-Flash | Xiaomi · Open weight | 39.9% | | |
| 110 | DeepSeek-R1 | DeepSeek · Open weight | 39.6% | | |
| 111 | Llama 4 Scout | Meta · Open weight | 39.5% | | |
| 112 | Mistral Medium 3 | Mistral · Closed | 39.3% | | |
| 113 | Gemini 2.5 Flash | Google · Closed | 39.0% | | |
| 114 | Llama 3.1 405B | Meta · Open weight | 39.0% | | |
| 115 | GPT-4.1 mini | OpenAI · Closed | 38.3% | | |
| 116 | Nemotron Ultra 253B | NVIDIA · Open weight | 38.2% | | |
| 117 | Nova Pro | Amazon · Closed | 38.1% | | |
| 118 | Gemma 4 E2B | Google · Open weight | 38.0% | | |
| 119 | DeepSeek V3.1 | DeepSeek · Open weight | 37.8% | | |
| 120 | GLM-4.5-Air | Z.AI · Closed | 37.6% | | |
| 121 | GLM-4.6 | Z.AI · Open weight | 36.7% | | |
| 122 | Grok 4.1 Fast | xAI · Closed | 36.5% | | |
| 123 | Mistral Large 3 | Mistral · Closed | 36.2% | | |
| 124 | Claude 3 Haiku | Anthropic · Closed | 36.1% | | |
| 125 | DeepSeek V3 | DeepSeek · Open weight | 34.8% | | |
| 126 | Sarvam 105B | Sarvam · Open weight | 34.4% | | |
| 127 | GPT-4o | OpenAI · Closed | 34.3% | | |
| 128 | Solar Pro 2 | Upstage · Closed | 33.7% | | |
| 129 | Exaone 4.0 32B | LG AI Research · Open weight | 33.5% | | |
| 130 | LFM2.5-VL-1.6B-Extract | LiquidAI · Open weight | 33.1% | | |
| 131 | GPT-4.1 nano | OpenAI · Closed | 32.0% | | |
| 132 | Ministral 3 14B (Reasoning) | Mistral · Open weight | 32.0% | | |
| 133 | Ministral 3 14B | Mistral · Open weight | 32.0% | | |
| 134 | Gemma 3 27B | Google · Open weight | 31.8% | | |
| 135 | Mistral Large 2 | Mistral · Closed | 31.2% | | |
| 136 | Qwen3-Omni-30B-A3B-Instruct | Alibaba · Open weight | 31.2% | | |
| 137 | GPT-4o mini | OpenAI · Closed | 31.0% | | |
| 138 | Ministral 3 8B (Reasoning) | Mistral · Open weight | 29.1% | | |
| 139 | Ministral 3 8B | Mistral · Open weight | 29.1% | | |
| 140 | Ministral 3 3B (Reasoning) | Mistral · Open weight | 26.8% | | |
| 141 | Ministral 3 3B | Mistral · Open weight | 26.8% | | |
| 142 | Sarvam 30B | Sarvam · Open weight | 26.5% | | |
| 143 | Granite-4.0-H-1B | IBM · Open weight | 26.2% | | |
| 144 | Exaone 4.0 1.2B | LG AI Research · Open weight | 25.3% | | |
| 145 | Phi-4 | Microsoft · Open weight | 23.5% | | |
| 146 | DeepSeek R1 Distill Qwen 32B | DeepSeek · Open weight | 22.9% | | |
| 147 | Granite-4.0-H-350M | IBM · Open weight | 17.6% | | |
| 148 | Granite-4.0-350M | IBM · Open weight | 15.9% | | |