context.vn

vals Proof Bench

54 models evaluated

#ModelProviderTypeScore
1Anthropicanthropic/claude-opus-5Claude Opus 578.00%
2OpenAIopenai/gpt-5.6-solGPT-5.6 Sol77.00%
3Anthropicanthropic/claude-fable-5Claude Fable 577.00%
4GPT-5.6 TerraOpenAI71.00%
5AristotleHarmonic71.00%
6Kimi K3Moonshot AI70.00%
7Claude Opus 4.8Anthropic69.00%
8Claude Sonnet 5Anthropic66.00%
9GPT-5.4OpenAI56.00%
10GPT-5.6 LunaOpenAI54.00%
11Claude Opus 4.7Anthropic54.00%
12GPT-5.5OpenAI50.00%
13Claude Opus 4.6 ThinkingAnthropic50.00%
14Claude Sonnet 4.6Anthropic45.00%
15Muse Spark 1.1Meta39.00%
16Gemini 3.6 FlashGoogle36.00%
17Claude Opus 4.5 20251101 ThinkingAnthropic36.00%
18GLM 5.2Zhipu AI35.00%
19Grok 4.5xAI30.00%
20Gemini 3.5 FlashGoogle29.00%
21Qwen3.7 MaxAlibaba26.00%
22Gemini 3.1 Pro PreviewGoogle26.00%
23Mimo V2.5 ProXiaomi24.00%
24GLM 5.1Zhipu AI22.22%
25GPT-5.4 MiniOpenAI21.00%
26Gemini 3 Pro PreviewGoogle20.00%
27MiniMax M3MiniMax19.00%
28Claude Sonnet 4.5 20250929 ThinkingAnthropic19.00%
29GPT-5OpenAI18.00%
30Muse SparkMeta17.00%
31Kimi K2.6Moonshot AI16.00%
32Mimo V2.5Xiaomi16.00%
33Gemini 3 Flash PreviewGoogle15.00%
34GPT-5.2OpenAI15.00%
35Grok 4.20 0309 ReasoningxAI14.00%
36Gemini 3.5 Flash LiteGoogle13.00%
37GPT-5 NanoOpenAI12.00%
38Grok 4.3xAI11.00%
39Mistral Medium 3.5Mistral AI10.00%
40DeepSeek V4 ProDeepSeek10.00%
41GPT-5.1 Codex MaxOpenAI9.00%
42GPT-5 MiniOpenAI9.00%
43Qwen3.6 27bAlibaba8.00%
44DeepSeek V3p2Fireworks AI8.00%
45GLM 4.7Zhipu AI6.00%
46GPT-5.4 NanoOpenAI5.00%
47Grok 4.1 Fast ReasoningxAI4.00%
48DeepSeek V3p2 ThinkingFireworks AI4.00%
49MiniMax M2.5MiniMax4.00%
50MiniMax M2.7MiniMax3.00%
51InklingThinkingmachines2.00%
52Nemotron 3 Ultra 550b A55bNvidia2.00%
53Laguna Xs.2Poolside0.00%
54Laguna M.1Poolside0.00%