context.vn

gpqa Diamond

45 models evaluated

#ModelProviderTypeScore
1Sakana Fugu-UltraSakana AIClosedsakana-fugu-ultra
2Sakana FuguSakana AIClosedsakana-fugu
3GPT-5.6 SolOpenAIClosedgpt-5-6-sol
4Gemini 3.1 ProGoogle · Closed94.3%
5Claude Opus 4.7 (Adaptive)Anthropic · Closed94.2%
6Claude Opus 4.8Anthropic · Closed93.6%
7GPT-5.5OpenAI · Closed93.6%
8Kimi K3Moonshot AI · Closed93.5%
9GPT-5.6 TerraOpenAI · Closed92.9%
10GPT-5.4OpenAI · Closed92.8%
11Gemini 3.5 FlashGoogle · Closed92.7%
12Qwen3.7 MaxAlibaba · Closed92.4%
13GPT-5.6 LunaOpenAI · Closed92.3%
14GLM-5.2Z.AI · Open weight91.2%
15Kimi K2.6Moonshot AI · Open weight90.5%
16Qwen3.7 PlusAlibaba · Closed90.3%
17DeepSeek V4 Pro (Max)DeepSeek · Open weight90.1%
18Interfaze BetaInterfaze · Closed89.9%
19Muse SparkMeta · Closed89.5%
20Claude Opus 4.6Anthropic · Closed89.2%
21DeepSeek V4 Pro (High)DeepSeek · Open weight89.1%
22Grok 4.20xAI · Closed88.5%
23DeepSeek V4 Flash (Max)DeepSeek · Open weight88.1%
24InklingThinking Machines Lab · Open weight87.9%
25Kimi K2.5Moonshot AI · Open weight87.6%
26DeepSeek V4 Flash (High)DeepSeek · Open weight87.4%
27Hy3 PreviewTencent · Open weight87.2%
28Nemotron 3 UltraNVIDIA · Open weight87.0%
29MiniMax M2.7MiniMax · Open weight87.0%
30GLM-5.1Z.AI · Open weight86.2%
31GLM-5Z.AI · Open weight86.0%
32MAI-Thinking-1Microsoft · Closed84.2%
33Gemma 4 12BGoogle · Open weight78.8%
34Trinity-Large-ThinkingArcee AI · Open weight76.3%
35DeepSeek V4 ProDeepSeek · Open weight72.9%
36Nemotron 3 Nano Omni 30B A3BNVIDIA · Open weight72.2%
37DeepSeek V4 FlashDeepSeek · Open weight71.2%
38ZAYA1-8BZyphra · Open weight71.0%
39Trinity-Large-PreviewArcee AI · Open weight63.3%
40Mellum2-12B-A2.5B-ThinkingJetBrains · Open weight57.6%
41ZAYA1-74B-PreviewZyphra · Open weight57.3%
42Soofi S 30B-A3BSoofi Project · Open weight43.4%
43Mellum2-12B-A2.5B-InstructJetBrains · Open weight40.9%
44MiniCPM5-1BOpenBMB · Open weight26.3%
45LFM2.5-230MLiquidAI · Open weight25.4%