context.vn
Menu

vals Proof Bench

35 models evaluated

#ModelProviderTypeScore
1Claude Opus 5.5AnthropicProprietary100.00%
2Claude Fable 5.1AnthropicProprietary100.00%
3logicalintelligence100.00%Alephprover
4GPT-6 AstraOpenAI · Closed99.00%
5Claude Opus 5Anthropic · Closed99.00%
6Claude Fable 5Anthropic · Closed95.00%
7Kimi K3Moonshot AI · Closed87.00%
8AristotleAristotle86.00%
9GPT-5.6 SolOpenAI · Closed83.00%
10Claude Sonnet 5Anthropic · Closed77.00%
11Hy4 previewTencent · Open weight75.00%
12GPT-5.6 TerraOpenAI · Closed74.00%
13GPT-5.6 LunaOpenAI · Closed60.00%
14Gemini 3.7 FlashGoogle · Closed58.00%
15Qwen3.8 MaxAlibaba · Open weight58.00%
16DeepSeek V4 Flash 0731DeepSeek · Closed56.00%
17DeepSeek V4.1 FlashDeepSeek · Open weight54.00%
18Grok 4.6xAI · Closed51.00%
19DeepSeek V4 Pro 0813DeepSeek · Closed50.00%
20GLM-5.3Z.AI · Open weight49.00%
21Gemini 3.8 FlashGoogle · Closed48.00%
22Muse Spark 1.2Meta · Closed43.00%
23Gemini 3.5 FlashGoogle · Closed31.00%
24Grok 4.5xAI · Closed31.00%
25Grok 4.7xAI · Closed26.00%
26Gemini 3.1 Pro PreviewGoogle26.00%
27MiMo-V2.5-ProXiaomi · Closed22.00%
28GLM-5.3-FlashZ.AI · Open weight21.00%
29MiniMax M3MiniMax · Open weight18.00%
31MiMo-V2.5Xiaomi · Closed16.00%
32Qwen3.8-27BAlibaba · Open weight16.00%
33Mistral Medium 3.5Mistral9.00%
34Inkling-SmallThinking Machines Lab · Open weight6.00%
35Mercury 2.5Inception · Closed3.00%
36InklingThinking Machines Lab · Open weight0.00%