context.vn
Menu

vals Gpqa Diamond

135 models evaluated

#ModelProviderTypeScore
1Googlehigh reasoningGemini 3.1 Pro Preview95.5%
2GPT-5.6 SolOpenAIProprietarymax reasoning
3Grok 4.6xAIProprietaryhigh reasoning
4Gemini 3.8 FlashGoogle · Closedhigh reasoning94.4%
5Gemini 3.7 FlashGoogle · Closedhigh reasoning93.9%
6Qwen3.8 MaxAlibaba · Open weight93.7%
7Gemini 3.6 FlashGoogle · Closedhigh reasoning93.4%
8Claude Opus 5Anthropic · Closed93.4%
9Claude Fable 5.1Anthropic · Closed93.4%
10Claude Fable 5Anthropic · Closed93.2%
11GPT-5.5OpenAI · Closedxhigh reasoning93.2%
12Kimi K3Moonshot AI · Closed92.9%
13Grok 4.5xAI · Closedhigh reasoning92.9%
14Gemini 3.5 FlashGoogle · Closedhigh reasoning92.7%
15MiniMax M3MiniMax · Open weight92.7%
16Claude Opus 4.8Anthropic · Closed92.4%
17DeepSeek V4 Pro 0813DeepSeek · Closedmax reasoning92.4%
18GPT-5.6 LunaOpenAI · Closedmax reasoning91.7%
19Gemini 3 Pro PreviewGooglehigh reasoning91.7%
20GPT-5.2OpenAI · Closedxhigh reasoning91.7%
21GPT-5.4OpenAI · Closedxhigh reasoning91.7%
22Grok 4.3xAI · Closed91.4%
23Muse Spark 1.1Meta · Closedxhigh reasoning91.2%
24GPT-5.6 TerraOpenAI · Closedxhigh reasoning90.9%
25Qwen3.7 MaxAlibaba · Closed90.2%
26Claude Opus 4.7Anthropic · Closed90.2%
27DeepSeek V4 Flash 0731DeepSeek · Closedhigh reasoning89.9%
28Muse SparkMeta · Closed89.6%
29Claude Opus 4.6 (Adaptive)Anthropic · Closed89.6%
31Kimi K2.6Moonshot AI · Open weight89.1%
32Claude Sonnet 5Anthropic · Closed88.9%
33Qwen3.8-27BAlibaba · Open weightxhigh reasoning88.9%
34Grok 4.20 0309 ReasoningxAI88.6%
35Grok 4 0709xAI88.1%
36GLM-5.3Z.AI · Open weightmax reasoning88.1%
37Gemini 3 Flash PreviewGooglehigh reasoning87.9%
38Qwen3.5 Plus ThinkingAlibaba87.4%
39Qwen3.6 PlusAlibaba · Closed87.4%
40InklingThinking Machines Lab · Open weight0.99 reasoning87.1%
41GPT-5.1OpenAI · Closedhigh reasoning86.6%
42MiniMax M2.7MiniMax · Open weight86.6%
43GLM-5.3-FlashZ.AI · Open weightmax reasoning86.4%
44Nemotron 3 Ultra 550b A55bNvidia86.1%
45Claude Opus 4.5 ThinkingAnthropic · Closed85.9%
46GPT-5OpenAIhigh reasoning85.6%
47GLM-5.2Z.AI · Open weight85.6%
48Claude Sonnet 4.6Anthropic · Closed85.6%
49Grok 4 Fast (Reasoning)xAI · Closed85.4%
50Ling 3.0 Flash 2607Ant84.8%
51Qwen3 MaxAlibaba · Closed84.8%
52GLM-5.1Z.AI · Open weight84.5%
53Grok 4.1 Fast (Reasoning)xAI · Closed84.3%
54o3OpenAI · Closedhigh reasoning84.1%
55Kimi K2.5 ThinkingMoonshot AI84.1%
56Gemini 3.5 Flash-LiteGoogle · Closedhigh reasoning83.8%
57Inkling-SmallThinking Machines Lab · Open weight0.99 reasoning83.6%
58GLM 5 ThinkingZhipu AI83.3%
59GPT-5.4 miniOpenAI · Closedxhigh reasoning83.1%
60Qwen3.5 FlashAlibaba · Closed82.8%
61MiMo-V2.5-ProXiaomi · Closed82.6%
62MiniMax M2.5MiniMax · Closed82.1%
63Claude Sonnet 4.5 ThinkingAnthropic · Closed81.6%
64Gemini 2.5 Flash Preview 09 2025Google81.6%
65MiMo-V2.5Xiaomi · Closed81.6%
66Gemini 3.1 Flash Lite PreviewGooglehigh reasoning81.1%
67Gemini 2.5 Pro Exp 03 25Google80.8%
68GPT-5 miniOpenAI · Closedhigh reasoning80.3%
69DeepSeek V3p2 ThinkingFireworks AIhigh reasoning80.3%
70GLM-4.7Z.AI · Open weight80.0%
71Claude Opus 4.5Anthropic · Closed79.5%
73Grok 3 Mini Fast High ReasoningxAIhigh reasoning79.3%
74GPT-OSS 120BOpenAI · Open weight78.5%
75MiniMax M2.1MiniMax78.5%
76Kimi K2 ThinkingMoonshot AI78.5%
77Qwen3 Max PreviewAlibaba77.8%
78GPT-5.4 nanoOpenAI · Closedhigh reasoning77.5%
79Gemini 2.5 Flash Preview 09 2025 ThinkingGoogle76.5%
80Claude Opus 4.1 20250805 ThinkingAnthropic76.3%
81DeepSeek V3p2Fireworks AInone reasoning76.3%
82o3-miniOpenAI · Closedhigh reasoning75.5%
83Claude 3.7 Sonnet 20250219 ThinkingAnthropic75.3%
84Claude Sonnet 4 20250514 ThinkingAnthropic75.0%
85O4 MiniOpenAIhigh reasoning74.5%
86GLM-4.6Z.AI · Open weight74.5%
87Grok 3xAI74.2%
88o1OpenAI · Closedhigh reasoning73.2%
89Grok 3 Mini Fast Low ReasoningxAIlow reasoning73.0%
90Claude Haiku 4.5 ThinkingAnthropic · Closed72.2%
91GLM-4.5Z.AI · Closed72.2%
92Claude Opus 4Anthropic71.7%
93Moonshotai Kimi K2 InstructTogether AI71.5%
94Gemini 2.5 Flash Lite Preview 09 2025 ThinkingGoogle70.2%
95Qwen3 235b A22bFireworks AI70.2%
96Claude Opus 4.1Anthropic70.0%
97Llama4 Maverick Instruct BasicFireworks AI69.4%
98Claude Sonnet 4Anthropic69.4%
99GPT-OSS 20BOpenAI · Open weight68.9%
100Mistral Large 2512Mistral AI68.4%
101GPT-4.1 miniOpenAI · Closedhigh reasoning67.9%
102Claude 3.7 SonnetAnthropic67.4%
103GPT-4.1OpenAI · Closedhigh reasoning65.4%
104Gemini 2.0 Flash 001Google65.2%
105Grok 4.1 Fast Non ReasoningxAI65.2%
106Gemini 2.5 Flash Lite Preview 09 2025Google64.1%
107GPT-5 nanoOpenAI · Closedhigh reasoning63.4%
108Langston Nim Nvidia Llama 3.3 Nemotron Super 49b V1 42e84561 ThinkingTogether AI62.4%
109Magistral Medium 2509Mistral AI62.4%
110Grok 4 Fast Non ReasoningxAI62.1%
111DeepSeek V3 0324Fireworks AI61.6%
112Claude 3.5 SonnetAnthropic · Closed59.3%
113MiMo-V2-FlashXiaomi · Open weight59.3%
114Gemini 1.5 Pro 002Google58.3%
115Magistral Small 2509Mistral AI58.3%
116Gemini 2.5 Flash Preview 04 17Google57.6%
117Laguna XS.2Poolside · Open weight55.0%
118DeepSeek V3DeepSeek · Open weight54.5%
119GPT-4oOpenAI · Closedhigh reasoning53.8%
120GPT-4.1 nanoOpenAI · Closedhigh reasoning50.8%
121Mistral Small 2402Mistral AI50.8%
122Grok 2 1212xAI50.8%
124Meta Llama Llama 3.3 70B Instruct TurboTogether AI50.0%
125Command A 03 2025Cohere48.5%
126Mistral Large 2411Mistral AI47.7%
127Langston Nim Nvidia Llama 3.3 Nemotron Super 49b V1 42e84561Together AI47.7%
128Meta Llama Llama 4 Scout 17B 16E InstructTogether AI47.0%
129Gemini 1.5 Flash 002Google46.0%
130Mistral Small 2503Mistral AI44.2%
131GPT-4o miniOpenAI · Closedhigh reasoning44.2%
132Claude 3.5 HaikuAnthropic37.9%
133Jamba Large 1.6AI21 Labs36.1%
134Mistral Medium 3.5Mistral AIhigh reasoning34.8%
135Jamba Mini 1.6AI21 Labs32.1%
136Command R PlusCohere31.1%
137GPT-3.5 TurboOpenAIhigh reasoning30.6%
138Laguna M.1Poolside · Closed27.0%