context.vn

vals Mmlu Pro

125 models evaluated

#ModelProviderTypeScore
1Anthropicanthropic/claude-opus-5Claude Opus 591.59%
2Anthropicanthropic/claude-fable-5Claude Fable 591.50%
3Googlegoogle/gemini-3.1-pro-previewGemini 3.1 Pro Preview90.99%
4Gemini 3 Pro PreviewGoogle90.10%
5Claude Opus 4.7Anthropic89.87%
6Claude Opus 4.8Anthropic89.58%
7Gemini 3.5 FlashGoogle89.52%
8Qwen3.7 MaxAlibaba89.31%
9Gemini 3.6 FlashGoogle89.28%
10Grok 4.5xAI89.22%
11Claude Opus 4.6 ThinkingAnthropic89.11%
12GPT-5.6 SolOpenAI89.10%
13Muse Spark 1.1Meta88.73%
14Gemini 3 Flash PreviewGoogle88.59%
15GPT-5.5OpenAI88.14%
16Kimi K3Moonshot AI87.97%
17Claude Opus 4.1 20250805 ThinkingAnthropic87.92%
18Qwen3.6 PlusAlibaba87.67%
19Kimi K2.6Moonshot AI87.57%
20Claude Sonnet 5Anthropic87.55%
21GPT-5.4OpenAI87.48%
22Claude Sonnet 4.5 20250929 ThinkingAnthropic87.36%
23Claude Sonnet 4.6Anthropic87.34%
24Muse SparkMeta87.32%
25Claude Opus 4.5 20251101 ThinkingAnthropic87.26%
26DeepSeek V4 ProDeepSeek87.25%
27Claude Opus 4.1Anthropic87.21%
28Qwen3.5 Plus ThinkingAlibaba87.18%
29MiniMax M2.1MiniMax87.05%
30GLM 5.1Zhipu AI86.90%
31GLM 5.2Zhipu AI86.71%
32GPT-5.6 TerraOpenAI86.66%
33GPT-5OpenAI86.54%
34GPT-5.1OpenAI86.38%
35InklingThinkingmachines86.30%
36Grok 4.20 0309 ReasoningxAI86.25%
37Gemini 3.1 Flash Lite PreviewGoogle86.24%
38GPT-5.2OpenAI86.23%
39Claude Opus 4Anthropic86.17%
40GPT-5.6 LunaOpenAI86.04%
41GLM 5 ThinkingZhipu AI86.03%
42Kimi K2.5 ThinkingMoonshot AI85.91%
43Grok 4.3xAI85.84%
44Gemini 3.5 Flash LiteGoogle85.84%
45Nemotron 3 Ultra 550b A55bNvidia85.76%
46O3OpenAI85.59%
47Claude Opus 4.5Anthropic85.59%
48Grok 4 0709xAI85.30%
49Qwen3 MaxAlibaba84.98%
50DeepSeek V3p2 ThinkingFireworks AI84.92%
51Mimo V2.5 ProXiaomi84.59%
52GPT-5.4 MiniOpenAI84.55%
53Qwen3 MaxAlibaba84.36%
54MiniMax M3MiniMax84.22%
55Grok 4.1 Fast ReasoningxAI84.18%
56Qwen3.5 FlashAlibaba84.06%
57Gemini 2.5 Pro Exp 03 25Google84.06%
58Claude Sonnet 4 20250514 ThinkingAnthropic83.86%
59Gemini 2.5 Flash Preview 09 2025Google83.69%
60Gemini 2.5 Flash Preview 09 2025 ThinkingGoogle83.66%
61Qwen3 Max PreviewAlibaba83.54%
62O1OpenAI83.49%
63DeepSeek R1Fireworks AI83.18%
64DeepSeek V3p2Fireworks AI83.06%
65Mimo V2.5Xiaomi82.93%
66GLM 4.7Zhipu AI82.74%
67Claude 3.7 Sonnet 20250219 ThinkingAnthropic82.73%
68GPT-5 MiniOpenAI82.23%
69GLM 4.6Zhipu AI82.20%
70Grok 3 Mini Fast High ReasoningxAI81.37%
71Qwen3 235b A22bFireworks AI81.25%
72GLM 4.5Zhipu AI81.22%
73Kimi K2 ThinkingMoonshot AI81.07%
74Claude 3.7 SonnetAnthropic80.66%
75O4 MiniOpenAI80.56%
76GPT-4.1OpenAI80.50%
77MiniMax M2.7MiniMax80.43%
78MiniMax M2.5MiniMax80.09%
79Grok 3 Mini Fast Low ReasoningxAI80.01%
80Grok 3xAI79.95%
81Mistral Large 2512Mistral AI79.82%
82Grok 4 Fast ReasoningxAI79.70%
83DeepSeek V3 0324Fireworks AI79.47%
84Claude Sonnet 4Anthropic79.43%
85Llama4 Maverick Instruct BasicFireworks AI79.42%
86Moonshotai Kimi K2 InstructTogether AI79.39%
87GPT Oss 120bFireworks AI79.17%
88Gemini 2.5 Flash Lite Preview 09 2025 ThinkingGoogle79.12%
89Claude Haiku 4.5 20251001 ThinkingAnthropic78.72%
90O3 MiniOpenAI78.69%
91Gemini 2.5 Flash Lite Preview 09 2025Google78.64%
92Claude 3.5 SonnetAnthropic78.40%
93Gemini 2.0 Flash 001Google77.38%
94GPT-4.1 MiniOpenAI77.22%
95GPT-5.4 NanoOpenAI77.17%
96GPT-5 NanoOpenAI76.07%
97Grok 2 1212xAI75.47%
98Mistral Medium 3.5Mistral AI75.33%
99Gemini 1.5 Pro 002Google75.29%
100Mistral Medium 2505Mistral AI75.29%
101Grok 4.1 Fast Non ReasoningxAI75.21%
102GPT-4oOpenAI74.13%
103DeepSeek V3Fireworks AI73.82%
104GPT-4oOpenAI72.56%
105GPT Oss 20bFireworks AI71.64%
106Langston Nim Nvidia Llama 3.3 Nemotron Super 49b V1 42e84561Together AI70.78%
107Grok 4 Fast Non ReasoningxAI70.34%
108Meta Llama Llama 3.3 70B Instruct TurboTogether AI69.86%
109Mistral Large 2411Mistral AI69.71%
110Meta Llama Llama 4 Scout 17B 16E InstructTogether AI69.63%
111Langston Nim Nvidia Llama 3.3 Nemotron Super 49b V1 42e84561 ThinkingTogether AI69.58%
112Laguna Xs.2Poolside69.41%
113Command A 03 2025Cohere69.17%
114Magistral Medium 2509Mistral AI68.66%
115Mistral Small 2503Mistral AI66.02%
116Gemini 1.5 Flash 002Google65.61%
117Mistral Small 2402Mistral AI64.44%
118Claude 3.5 HaikuAnthropic64.12%
119GPT-4.1 NanoOpenAI63.48%
120Laguna M.1Poolside63.48%
121GPT-4o MiniOpenAI62.73%
122Magistral Small 2509Mistral AI62.13%
123Jamba Large 1.6AI21 Labs49.78%
124Command R PlusCohere44.00%
125Jamba Mini 1.6AI21 Labs30.28%