context.vn
Menu

vals Mmlu Pro

135 models evaluated

#ModelProviderTypeScore
1Claude Fable 5.1AnthropicProprietary92.4%
2Claude Opus 5AnthropicProprietary91.6%
3Claude Fable 5AnthropicProprietary91.5%
4Gemini 3.1 Pro PreviewGooglehigh reasoning91.0%
5Gemini 3.8 FlashGoogle · Closedhigh reasoning90.2%
6Gemini 3.7 FlashGoogle · Closedhigh reasoning90.1%
7Gemini 3 Pro PreviewGoogle90.1%
8Claude Opus 4.7Anthropic · Closed89.9%
9Claude Opus 4.8Anthropic · Closed89.6%
10Gemini 3.5 FlashGoogle · Closedhigh reasoning89.5%
11Grok 4.6xAI · Closedhigh reasoning89.4%
12Qwen3.7 MaxAlibaba · Closed89.3%
13Gemini 3.6 FlashGoogle · Closedhigh reasoning89.3%
14Grok 4.5xAI · Closedhigh reasoning89.2%
15Claude Opus 4.6 (Adaptive)Anthropic · Closed89.1%
16GPT-5.6 SolOpenAI · Closedmax reasoning89.1%
17Muse Spark 1.1Meta · Closedxhigh reasoning88.7%
18Qwen3.8 MaxAlibaba · Open weight88.6%
19Gemini 3 Flash PreviewGooglehigh reasoning88.6%
20Muse Spark 1.2Meta · Closedxhigh reasoning88.3%
21GPT-5.5OpenAI · Closedxhigh reasoning88.1%
22Kimi K3Moonshot AI · Closedmax reasoning88.0%
23Claude Opus 4.1 20250805 ThinkingAnthropic87.9%
24Qwen3.6 PlusAlibaba · Closed87.7%
25Kimi K2.6Moonshot AI · Open weight87.6%
26Claude Sonnet 5Anthropic · Closed87.5%
27GPT-5.4OpenAI · Closedxhigh reasoning87.5%
28Claude Sonnet 4.5 ThinkingAnthropic · Closed87.4%
29Claude Sonnet 4.6Anthropic · Closed87.3%
30Muse SparkMeta · Closed87.3%
31Claude Opus 4.5 ThinkingAnthropic · Closed87.3%
32DeepSeek V4 Pro 0813DeepSeek · Closedmax reasoning87.2%
33Claude Opus 4.1Anthropic87.2%
34Qwen3.5 Plus ThinkingAlibaba87.2%
35MiniMax M2.1MiniMax87.0%
37GLM-5.1Z.AI · Open weight86.9%
38GLM-5.3Z.AI · Open weightmax reasoning86.8%
39GLM-5.2Z.AI · Open weight86.7%
40GPT-5.6 TerraOpenAI · Closedxhigh reasoning86.7%
41GPT-5OpenAIhigh reasoning86.5%
42GPT-5.1OpenAI · Closedhigh reasoning86.4%
43InklingThinking Machines Lab · Open weight0.99 reasoning86.3%
44Grok 4.20 0309 ReasoningxAI86.3%
45Gemini 3.1 Flash Lite PreviewGoogle86.2%
46GPT-5.2OpenAI · Closedxhigh reasoning86.2%
47DeepSeek V4 Flash 0731DeepSeek · Closedhigh reasoning86.2%
48Claude Opus 4Anthropic86.2%
49GLM-5.3-FlashZ.AI · Open weightmax reasoning86.1%
50GPT-5.6 LunaOpenAI · Closedmax reasoning86.0%
51GLM 5 ThinkingZhipu AI86.0%
52Kimi K2.5 ThinkingMoonshot AI85.9%
53Grok 4.3xAI · Closedhigh reasoning85.8%
54Gemini 3.5 Flash-LiteGoogle · Closedhigh reasoning85.8%
55Nemotron 3 Ultra 550b A55bNvidia85.8%
56o3OpenAI · Closedhigh reasoning85.6%
57Claude Opus 4.5Anthropic · Closed85.6%
58Inkling-SmallThinking Machines Lab · Open weight0.99 reasoning85.6%
59Grok 4 0709xAI85.3%
60Qwen3 MaxAlibaba · Closed85.0%
61DeepSeek V3p2 ThinkingFireworks AI84.9%
62MiMo-V2.5-ProXiaomi · Closed84.6%
63GPT-5.4 miniOpenAI · Closedxhigh reasoning84.6%
65Qwen3.8-27BAlibaba · Open weightxhigh reasoning84.3%
66MiniMax M3MiniMax · Open weight84.2%
67Grok 4.1 Fast (Reasoning)xAI · Closed84.2%
68Qwen3.5 FlashAlibaba · Closed84.1%
69Gemini 2.5 Pro Exp 03 25Google84.1%
70Claude Sonnet 4 20250514 ThinkingAnthropic83.9%
71Gemini 2.5 Flash Preview 09 2025Google83.7%
72Gemini 2.5 Flash Preview 09 2025 ThinkingGoogle83.7%
73Qwen3 Max PreviewAlibaba83.5%
74o1OpenAI · Closedhigh reasoning83.5%
75DeepSeek-R1DeepSeek · Open weight83.2%
76DeepSeek V3p2Fireworks AI83.1%
77MiMo-V2.5Xiaomi · Closed82.9%
78GLM-4.7Z.AI · Open weight82.7%
79Claude 3.7 Sonnet 20250219 ThinkingAnthropic82.7%
80GPT-5 miniOpenAI · Closedhigh reasoning82.2%
81GLM-4.6Z.AI · Open weight82.2%
82Ling 3.0 Flash 2607Ant82.0%
83Grok 3 Mini Fast High ReasoningxAIhigh reasoning81.4%
84Qwen3 235b A22bFireworks AI81.2%
85GLM-4.5Z.AI · Closed81.2%
86Kimi K2 ThinkingMoonshot AI81.1%
87Claude 3.7 SonnetAnthropic80.7%
88O4 MiniOpenAIhigh reasoning80.6%
89GPT-4.1OpenAI · Closedhigh reasoning80.5%
90MiniMax M2.7MiniMax · Open weight80.4%
91MiniMax M2.5MiniMax · Closed80.1%
92Grok 3 Mini Fast Low ReasoningxAIlow reasoning80.0%
93Grok 3xAI79.9%
94Mistral Large 2512Mistral AI79.8%
95Grok 4 Fast (Reasoning)xAI · Closed79.7%
96DeepSeek V3 0324Fireworks AI79.5%
97Claude Sonnet 4Anthropic79.4%
98Llama4 Maverick Instruct BasicFireworks AI79.4%
99Moonshotai Kimi K2 InstructTogether AI79.4%
100GPT-OSS 120BOpenAI · Open weight79.2%
101Gemini 2.5 Flash Lite Preview 09 2025 ThinkingGoogle79.1%
102Claude Haiku 4.5 ThinkingAnthropic · Closed78.7%
103o3-miniOpenAI · Closedhigh reasoning78.7%
104Gemini 2.5 Flash Lite Preview 09 2025Google78.6%
105Claude 3.5 SonnetAnthropic · Closed78.4%
106Gemini 2.0 Flash 001Google77.4%
107GPT-4.1 miniOpenAI · Closedhigh reasoning77.2%
108GPT-5.4 nanoOpenAI · Closedhigh reasoning77.2%
109GPT-5 nanoOpenAI · Closedhigh reasoning76.1%
110Grok 2 1212xAI75.5%
111Mistral Medium 3.5Mistral AIhigh reasoning75.3%
112Gemini 1.5 Pro 002Google75.3%
113Mistral Medium 2505Mistral AI75.3%
114Grok 4.1 Fast Non ReasoningxAI75.2%
115GPT-4oOpenAI · Closedhigh reasoning74.1%
116DeepSeek V3DeepSeek · Open weight73.8%
118GPT-OSS 20BOpenAI · Open weight71.6%
119Langston Nim Nvidia Llama 3.3 Nemotron Super 49b V1 42e84561Together AI70.8%
120Grok 4 Fast Non ReasoningxAI70.3%
121Meta Llama Llama 3.3 70B Instruct TurboTogether AI69.9%
122Mistral Large 2411Mistral AI69.7%
123Meta Llama Llama 4 Scout 17B 16E InstructTogether AI69.6%
124Langston Nim Nvidia Llama 3.3 Nemotron Super 49b V1 42e84561 ThinkingTogether AI69.6%
125Command A 03 2025Cohere69.2%
126Laguna XS.2Poolside · Open weight69.0%
127Laguna M.1Poolside · Closed68.8%
128Magistral Medium 2509Mistral AI68.7%
129Mistral Small 2503Mistral AI66.0%
130Gemini 1.5 Flash 002Google65.6%
131Mistral Small 2402Mistral AI64.4%
132Claude 3.5 HaikuAnthropic64.1%
133GPT-4.1 nanoOpenAI · Closedhigh reasoning63.5%
134GPT-4o miniOpenAI · Closedhigh reasoning62.7%
135Magistral Small 2509Mistral AI62.1%
136Jamba Large 1.6AI21 Labs49.8%
137Command R PlusCohere44.0%
138Jamba Mini 1.6AI21 Labs30.3%