context.vn
Menu

vals Index

59 models evaluated

#ModelProviderTypeScore
1Claude Fable 5.1AnthropicProprietary68.83%
2Claude Opus 5AnthropicProprietary67.21%
3GPT-6 AstraOpenAIProprietarymax reasoning
4Claude Opus 5.5Anthropic · Closed66.16%
5Claude Fable 5Anthropic · Closed66.04%
6Muse Spark 1.3 MaxMetamax reasoning64.53%
7GPT-5.6 SolOpenAI · Closedmax reasoning63.71%
8Gemini 3.8 FlashGoogle · Closedhigh reasoning62.25%
9Claude Opus 4.8Anthropic · Closed60.91%
10Muse Spark 1.3Meta · Closedxhigh reasoning60.31%
11Grok 4.7xAI · Closedxhigh reasoning60.20%
12GPT-5.6 LunaOpenAI · Closedmax reasoning59.88%
13Claude Sonnet 5Anthropic · Closed59.61%
14GPT-5.6 TerraOpenAI · Closedmax reasoning59.59%
15Gemini 3.7 FlashGoogle · Closedhigh reasoning59.31%
16Grok 4.6xAI · Closedhigh reasoning59.17%
17DeepSeek V4.1 FlashDeepSeek · Open weighthigh reasoning57.86%
18Kimi K3Moonshot AI · Closed57.81%
19GPT-5.5OpenAI · Closedxhigh reasoning57.41%
20Muse Spark 1.2Meta · Closedxhigh reasoning57.05%
21GLM-5.3Z.AI · Open weightmax reasoning56.97%
22Claude Opus 4.7Anthropic · Closed56.11%
23Hy4 previewTencent · Open weight55.40%
24Gemini 3.6 FlashGoogle · Closedhigh reasoning55.35%
25Muse Spark 1.1Meta · Closedxhigh reasoning54.75%
26DeepSeek V4 Flash 0731DeepSeek · Closedhigh reasoning53.57%
27GLM-5.2Z.AI · Open weight53.12%
28Gemini 3.5 FlashGoogle · Closedhigh reasoning53.08%
29DeepSeek V4 Pro 0813DeepSeek · Closedmax reasoning52.37%
30Qwen3.8 MaxAlibaba · Open weight51.84%
31Grok 4.5xAI · Closedhigh reasoning51.53%
32Claude Sonnet 4.6Anthropic · Closed50.59%
33Qwen3.8-27BAlibaba · Open weightxhigh reasoning48.48%
34GLM-5.3-FlashZ.AI · Open weightmax reasoning47.22%
35Qwen3.7 MaxAlibaba · Closed44.77%
36Kimi K2.6Moonshot AI · Open weight43.47%
38MiniMax M3MiniMax · Open weight42.72%
39Gemini 3.1 Pro PreviewGooglehigh reasoning41.90%
40MiMo-V2.5-ProXiaomi · Closed40.97%
41MiMo-V2.5Xiaomi · Closed39.91%
42GPT-5.4 miniOpenAI · Closedxhigh reasoning39.63%
43Qwen3.7 PlusAlibaba · Closed38.65%
44Gemini 3.5 Flash-LiteGoogle · Closedhigh reasoning36.71%
45InklingThinking Machines Lab · Open weight0.99 reasoning34.10%
46GPT-5.4 nanoOpenAI · Closedhigh reasoning33.00%
47Qwen3.6 PlusAlibaba · Closed31.98%
48Inkling-SmallThinking Machines Lab · Open weight0.99 reasoning31.86%
49Gemini 3 Flash PreviewGooglehigh reasoning29.44%
50Nemotron 3 Ultra 550b A55bNvidia27.39%
51Kimi K2.5 ThinkingMoonshot AI26.30%
52MiniMax M2.7MiniMax · Open weight24.56%
53Grok 4.3xAI · Closedhigh reasoning24.29%
54Claude Haiku 4.5 ThinkingAnthropic · Closed22.90%
55Ling 3.0 Flash 2607Ant21.70%
56Mistral Medium 3.5Mistral AIhigh reasoning17.95%
57Grok 4.20 0309 ReasoningxAI17.55%
58Gemini 3.1 Flash Lite PreviewGooglehigh reasoning15.46%
59Mercury 2.5Inception · Closedhigh reasoning12.95%
60Nemotron Lightning 3p5 30b A3bFireworks AI11.49%