| 1 | GPT-6 Astra | OpenAI | Proprietary | 96.1% | |
| 2 | Gemini 3.8 Flash | Google | Proprietary | 95.3% | |
| 3 | Grok 4.6 | xAI | Proprietary | 94.9% | |
| 4 | Gemini 3.7 Flash | Google · Closed | 94.5% | | |
| 5 | GPT-5.6 Sol | OpenAI · Closed | 94.1% | | |
| 6 | Gemini 3.1 Pro | Google · Closed | 94.1% | | |
| 7 | Claude Fable 5.1 | Anthropic · Closed | 93.7% | | |
| 8 | Kimi K3 | Moonshot AI · Closed | 93.5% | | |
| 9 | GPT-5.5 | OpenAI · Closed | 93.5% | | |
| 10 | Muse Spark 1.3 | Meta · Closed | 93.5% | | |
| 11 | Claude Opus 5 | Anthropic · Closed | 93.2% | | |
| 12 | Grok 4.5 | xAI · Closed | 93.1% | | |
| 13 | MiniMax M3 | MiniMax · Open weight | 92.9% | | |
| 14 | DeepSeek V4 Pro 0813 | DeepSeek · Closed | 92.8% | | |
| 15 | Gemini 3.6 Flash | Google · Closed | 92.8% | | |
| 16 | Qwen3.8 Max Preview | Alibaba · Closed | 92.8% | | |
| 17 | Claude Fable 5 | Anthropic · Closed | 92.6% | | |
| 18 | GPT-5.6 Terra | OpenAI · Closed | 92.5% | | |
| 19 | Qwen3.7 Max | Alibaba · Closed | 92.3% | | |
| 20 | Qwen3.8-Flash-Next | Alibaba · Open weight | 92.3% | | |
| 21 | Gemini 3.5 Flash | Google · Closed | 92.2% | | |
| 22 | Claude Opus 4.8 | Anthropic · Closed | 92.0% | | |
| 23 | GPT-5.4 | OpenAI · Closed | 92.0% | | |
| 24 | GLM-5.3 | Z.AI · Open weight | 91.7% | | |
| 25 | GPT-5.3 Codex | OpenAI · Closed | 91.5% | | |
| 26 | GPT-5.3-Codex-Spark | OpenAI · Closed | 91.5% | | |
| 27 | Claude Opus 4.7 (Adaptive) | Anthropic · Closed | 91.4% | | |
| 28 | GLM-5.3-Flash | Z.AI · Open weight | 91.2% | | |
| 29 | Claude Sonnet 5 | Anthropic · Closed | 91.1% | | |
| 30 | GPT-5.6 Luna | OpenAI · Closed | 91.1% | | |
| 31 | Kimi K2.6 | Moonshot AI · Open weight | 91.1% | | |
| 32 | Gemini 3 Pro | Google · Closed | 90.8% | | |
| 33 | DeepSeek V4 Flash 0731 | DeepSeek · Closed | 90.8% | | |
| 34 | Qwen3.8-27B | Alibaba · Open weight | 90.5% | | |
| 36 | Muse Spark 1.2 | Meta · Closed | 90.4% | | |
| 37 | GPT-5.2 | OpenAI · Closed | 90.3% | | |
| 38 | Grok 4.3 | xAI · Closed | 90.1% | | |
| 39 | Qwen3.7 Plus | Alibaba · Closed | 90.0% | | |
| 40 | GPT-5.2-Codex | OpenAI · Closed | 89.9% | | |
| 41 | Muse Spark 1.1 | Meta · Closed | 89.8% | | |
| 42 | Hy3 | Tencent · Open weight | 89.7% | | |
| 43 | Hy3 Preview | Tencent · Open weight | 89.7% | | |
| 44 | Kimi K2.7 Code | Moonshot AI · Open weight | 89.6% | | |
| 45 | Claude Opus 4.6 (Adaptive) | Anthropic · Closed | 89.6% | | |
| 46 | GLM-5.2 | Z.AI · Open weight | 89.5% | | |
| 47 | Inkling-Small | Thinking Machines Lab · Open weight | 89.5% | | |
| 48 | Solar Pro 4 | Upstage · Closed | 89.1% | | |
| 49 | Qwen 3.6 Max (preview) | Alibaba · Closed | 88.8% | | |
| 50 | Claude Opus 4.7 | Anthropic · Closed | 88.5% | | |
| 51 | Muse Spark | Meta · Closed | 88.4% | | |
| 52 | Qwen3.6 Plus | Alibaba · Closed | 88.2% | | |
| 53 | Kimi K2.5 | Moonshot AI · Open weight | 87.9% | | |
| 54 | Kimi K2.5 (Reasoning) | Moonshot AI · Closed | 87.9% | | |
| 55 | Grok 4 | xAI · Closed | 87.7% | | |
| 56 | GPT-5.4 mini | OpenAI · Closed | 87.5% | | |
| 57 | MiniMax M2.7 | MiniMax · Open weight | 87.4% | | |
| 58 | GPT-5.1 | OpenAI · Closed | 87.3% | | |
| 59 | Inkling | Thinking Machines Lab · Open weight | 87.2% | | |
| 60 | MiMo-V2-Pro | Xiaomi · Closed | 87.0% | | |
| 61 | GLM-5.1 | Z.AI · Open weight | 86.8% | | |
| 62 | Nemotron 3 Ultra | NVIDIA · Open weight | 86.7% | | |
| 63 | Claude Opus 4.5 Thinking | Anthropic · Closed | 86.6% | | |
| 64 | MiMo-V2.5-Pro | Xiaomi · Closed | 86.6% | | |
| 65 | Apodex 1.1 | Apodex · Closed | 86.4% | | |
| 66 | Apodex 1.1 Mini | Apodex · Open weight | 86.4% | | |
| 67 | Ling 3.0 Flash VL | InclusionAI · Open weight | 86.2% | | |
| 68 | Qwen3.5 397B | Alibaba · Open weight | 86.1% | | |
| 69 | Qwen3.5 397B (Reasoning) | Alibaba · Open weight | 86.1% | | |
| 70 | GPT-5.1-Codex | OpenAI · Closed | 86.0% | | |
| 71 | GPT-5.1-Codex-Max | OpenAI · Closed | 86.0% | | |
| 72 | GLM-4.7 | Z.AI · Open weight | 85.9% | | |
| 73 | Qwen3.5-27B | Alibaba · Open weight | 85.8% | | |
| 74 | Gemma 4 31B | Google · Open weight | 85.7% | | |
| 75 | Qwen3.5-122B-A10B | Alibaba · Open weight | 85.7% | | |
| 76 | A.X K2 | SK Telecom · Open weight | 85.7% | | |
| 77 | Ling 3.0 Flash | InclusionAI · Open weight | 85.5% | | |
| 78 | Ling 3.0 Flash FP8 | InclusionAI · Open weight | 85.5% | | |
| 79 | GPT-5 (high) | OpenAI · Closed | 85.4% | | |
| 80 | Grok 4.1 Fast (Reasoning) | xAI · Closed | 85.3% | | |
| 81 | MiniMax M2.5 | MiniMax · Closed | 84.8% | | |
| 82 | GLM-5-Turbo | Z.AI · Closed | 84.7% | | |
| 83 | Grok 4 Fast (Reasoning) | xAI · Closed | 84.7% | | |
| 84 | Qwen3.5-35B-A3B | Alibaba · Open weight | 84.5% | | |
| 85 | o3-pro | OpenAI · Closed | 84.5% | | |
| 86 | Gemini 2.5 Pro | Google · Closed | 84.4% | | |
| 87 | Qwen3.6-27B | Alibaba · Open weight | 84.2% | | |
| 88 | GPT-5 (medium) | OpenAI · Closed | 84.2% | | |
| 89 | Qwen3.6-35B-A3B | Alibaba · Open weight | 84.1% | | |
| 90 | Claude Opus 4.6 | Anthropic · Closed | 84.0% | | |
| 91 | Gemini 3.5 Flash-Lite | Google · Closed | 83.8% | | |
| 92 | Muse Glimmer 30B | Meta · Open weight | 83.5% | | |
| 93 | K-EXAONE 2.0 | LG AI Research · Open weight | 82.9% | | |
| 94 | MiMo-V2-Omni | Xiaomi · Closed | 82.8% | | |
| 95 | GPT-5 mini | OpenAI · Closed | 82.8% | | |
| 96 | o3 | OpenAI · Closed | 82.7% | | |
| 97 | Step 3.5 Flash | StepFun · Open weight | 82.6% | | |
| 98 | GLM-5 | Z.AI · Open weight | 82.0% | | |
| 99 | GPT-5.4 nano | OpenAI · Closed | 81.7% | | |
| 100 | DeepSeek-R1 | DeepSeek · Open weight | 81.3% | | |
| 101 | Gemini 3 Flash | Google · Closed | 81.2% | | |
| 102 | Claude Opus 4.5 | Anthropic · Closed | 81.0% | | |
| 103 | Claude 4.1 Opus Thinking | Anthropic · Closed | 80.9% | | |
| 104 | GLM-5V-Turbo | Z.AI · Closed | 80.9% | | |
| 105 | Step 3.7 Flash | StepFun · Open weight | 80.9% | | |
| 106 | Nemotron 3 Super 100B | NVIDIA · Open weight | 80.0% | | |
| 107 | Nemotron 3 Super 120B A12B | NVIDIA · Open weight | 80.0% | | |
| 108 | Claude Sonnet 4.6 | Anthropic · Closed | 79.9% | | |
| 109 | Gemma 4 26B A4B | Google · Open weight | 79.2% | | |
| 110 | K-Exaone | LG AI Research · Closed | 78.3% | | |
| 111 | GPT-OSS 120B | OpenAI · Open weight | 78.2% | | |
| 112 | DeepSeek V3.1 (Reasoning) | DeepSeek · Open weight | 77.9% | | |
| 113 | Mercury 2 | Inception · Closed | 77.0% | | |
| 114 | Mistral Small 4 | Mistral · Open weight | 76.9% | | |
| 115 | Mistral Small 4 (Reasoning) | Mistral · Open weight | 76.9% | | |
| 116 | Kimi K2 | Moonshot AI · Closed | 76.6% | | |
| 117 | o1-preview | OpenAI · Closed | 76.5% | | |
| 118 | Qwen3 Max | Alibaba · Closed | 76.4% | | |
| 119 | Command A+ | Cohere · Open weight | 76.1% | | |
| 120 | Nemotron 3 Nano 30B | NVIDIA · Open weight | 75.7% | | |
| 121 | North Mini Code | Cohere · Open weight | 75.7% | | |
| 122 | Gemma 4 12B | Google · Open weight | 75.3% | | |
| 123 | Trinity-Large-Thinking | Arcee AI · Open weight | 75.2% | | |
| 124 | Trinity-Large-Preview | Arcee AI · Open weight | 75.2% | | |
| 125 | DeepSeek V3.2 | DeepSeek · Open weight | 75.1% | | |
| 126 | Mistral Medium 3.5 128B | Mistral · Open weight | 74.8% | | |
| 127 | o3-mini | OpenAI · Closed | 74.8% | | |
| 128 | o1 | OpenAI · Closed | 74.7% | | |
| 129 | Nemotron 3.5 Lightning 30B A3B NVFP4 | NVIDIA · Open weight | 74.3% | | |
| 130 | Sarvam 105B | Sarvam · Open weight | 73.8% | | |
| 131 | DeepSeek V3.1 | DeepSeek · Open weight | 73.5% | | |
| 132 | Ling 3.0 Tiny | InclusionAI · Open weight | 73.4% | | |
| 133 | GLM-4.5-Air | Z.AI · Closed | 73.3% | | |
| 134 | Quasar 438B | Multiverse Computing · Closed | 73.2% | | |
| 135 | Nemotron Ultra 253B | NVIDIA · Open weight | 72.8% | | |
| 136 | Grok Code Fast 1 | xAI · Closed | 72.7% | | |
| 137 | Qwen3-Omni-30B-A3B-Thinking | Alibaba · Open weight | 72.6% | | |
| 138 | Solar Pro 3 | Upstage · Closed | 72.4% | | |
| 139 | MiniCPM5-2B | OpenBMB · Open weight | 70.2% | | |
| 140 | MiniMax M1 80k | MiniMax · Closed | 69.7% | | |
| 141 | GPT-OSS 20B | OpenAI · Open weight | 68.8% | | |
| 142 | Claude 4 Sonnet | Anthropic · Closed | 68.3% | | |
| 143 | Gemini 2.5 Flash | Google · Closed | 68.3% | | |
| 144 | Mistral Large 3 | Mistral · Closed | 68.0% | | |
| 145 | GPT-5 nano | OpenAI · Closed | 67.6% | | |
| 146 | Llama 4 Maverick | Meta · Open weight | 67.1% | | |
| 147 | GPT-4.1 | OpenAI · Closed | 66.6% | | |
| 148 | GPT-4.1 mini | OpenAI · Closed | 66.4% | | |
| 149 | MiMo-V2-Flash | Xiaomi · Open weight | 65.6% | | |
| 150 | Granite 4.2 30B | IBM · Open weight | 64.4% | | |
| 151 | Grok 4.1 Fast | xAI · Closed | 63.7% | | |
| 152 | Sarvam 30B | Sarvam · Open weight | 63.3% | | |
| 153 | GLM-4.6 | Z.AI · Open weight | 63.2% | | |
| 154 | Celeris-1 | Celeris · Closed | 63.1% | | |
| 155 | Granite 4.2 8B | IBM · Open weight | 63.1% | | |
| 156 | Exaone 4.0 32B | LG AI Research · Open weight | 62.8% | | |
| 157 | Qwen3-Omni-30B-A3B-Instruct | Alibaba · Open weight | 62.0% | | |
| 158 | DeepSeek R1 Distill Qwen 32B | DeepSeek · Open weight | 61.5% | | |
| 159 | Ling 2.6 Flash | InclusionAI · Open weight | 59.3% | | |
| 160 | Gemini 1.5 Pro | Google · Closed | 58.9% | | |
| 161 | Llama 4 Scout | Meta · Open weight | 58.7% | | |
| 162 | GLM-4.7-Flash | Z.AI · Open weight | 58.1% | | |
| 163 | Mistral Medium 3 | Mistral · Closed | 57.8% | | |
| 164 | Gemma 4 E4B | Google · Open weight | 57.6% | | |
| 165 | Phi-4 | Microsoft · Open weight | 57.5% | | |
| 166 | Ministral 3 14B (Reasoning) | Mistral · Open weight | 57.2% | | |
| 167 | Ministral 3 14B | Mistral · Open weight | 57.2% | | |
| 168 | Solar Pro 2 | Upstage · Closed | 56.1% | | |
| 169 | Granite 4.2 3B | IBM · Open weight | 55.9% | | |
| 170 | LFM2.5-2.6B | LiquidAI · Open weight | 55.8% | | |
| 171 | DeepSeek V3 | DeepSeek · Open weight | 55.7% | | |
| 172 | GPT-4o | OpenAI · Closed | 54.3% | | |
| 173 | Llama 3.1 405B | Meta · Open weight | 51.5% | | |
| 174 | LFM2.5-8B-A1B | LiquidAI · Open weight | 51.3% | | |
| 175 | GPT-4.1 nano | OpenAI · Closed | 51.2% | | |
| 176 | Nova Pro | Amazon · Closed | 49.9% | | |
| 177 | Ultravox v0.6 Llama 3.3 70B | Fixie AI · Open weight | 49.8% | | |
| 178 | Claude 3 Opus | Anthropic · Closed | 48.9% | | |
| 179 | Mistral Large 2 | Mistral · Closed | 48.6% | | |
| 180 | LFM2-24B-A2B | LiquidAI · Closed | 47.4% | | |
| 181 | Ministral 3 8B (Reasoning) | Mistral · Open weight | 47.1% | | |
| 182 | Ministral 3 8B | Mistral · Open weight | 47.1% | | |
| 183 | Nemotron 3 Nano Omni 30B A3B | NVIDIA · Open weight | 46.9% | | |
| 184 | Gemma 4 E2B | Google · Open weight | 43.3% | | |
| 185 | Gemma 3 27B | Google · Open weight | 42.8% | | |
| 186 | GPT-4o mini | OpenAI · Closed | 42.6% | | |
| 187 | Exaone 4.0 1.2B | LG AI Research · Open weight | 42.4% | | |
| 188 | Qwen2.5 Coder 32B Instruct | Alibaba · Open weight | 41.7% | | |
| 189 | Claude 3 Haiku | Anthropic · Closed | 37.4% | | |
| 190 | Ministral 3 3B (Reasoning) | Mistral · Open weight | 35.8% | | |
| 191 | Ministral 3 3B | Mistral · Open weight | 35.8% | | |
| 192 | LFM2.5-1.2B-Thinking | LiquidAI · Closed | 33.9% | | |
| 193 | LFM2.5-1.2B-Instruct | LiquidAI · Closed | 32.6% | | |
| 194 | Phi-4 Multimodal Instruct | Microsoft · Open weight | 31.5% | | |
| 195 | LFM2.5-VL-1.6B-Extract | LiquidAI · Open weight | 28.9% | | |
| 196 | Gemini 1.0 Pro | Google · Closed | 27.7% | | |
| 197 | Granite-4.0-H-1B | IBM · Open weight | 26.3% | | |
| 198 | Granite-4.0-350M | IBM · Open weight | 26.1% | | |
| 199 | Granite-4.0-H-350M | IBM · Open weight | 25.7% | | |