context.vn
Menu

vals Corp Fin V2

131 models evaluated

#ModelProviderTypeScore
1Claude Opus 5AnthropicProprietary73.19%
2Claude Fable 5AnthropicProprietary71.83%
3Kimi K3Moonshot AIProprietary71.56%
4Muse Spark 1.1Meta · Closedxhigh reasoning71.29%
5Muse Spark 1.2Meta · Closedxhigh reasoning70.94%
6Inkling-SmallThinking Machines Lab · Open weight0.99 reasoning69.62%
7InklingThinking Machines Lab · Open weight0.99 reasoning68.57%
8Grok 4.3xAI · Closed68.53%
9GPT-5.5OpenAI · Closedxhigh reasoning68.42%
10Kimi K2.5 ThinkingMoonshot AI68.26%
11MiniMax M3MiniMax · Open weight68.10%
12Qwen3 MaxAlibaba · Closed68.03%
13Grok 4.5xAI · Closedhigh reasoning67.41%
14Claude Opus 4.6 (Adaptive)Anthropic · Closed67.02%
15Claude Sonnet 5Anthropic · Closed66.98%
16Grok 4 Fast (Reasoning)xAI · Closed66.90%
17Kimi K2.6Moonshot AI · Open weight66.74%
18Claude Opus 4.8Anthropic · Closed66.71%
19Qwen 3.6 Max (preview)Alibaba · Closed66.47%
20Gemini 3 Flash PreviewGooglehigh reasoning66.43%
21Grok 4.6xAI · Closedhigh reasoning66.16%
22GLM-5.2Z.AI · Open weight66.12%
23Claude Opus 4.7Anthropic · Closed66.08%
24Grok 4 0709xAI66.05%
25Grok 4.1 Fast (Reasoning)xAI · Closed65.97%
26GPT-5.2OpenAI · Closedxhigh reasoning65.89%
27Qwen3.8 MaxAlibaba · Open weight65.85%
28Nemotron 3 Ultra 550b A55bNvidia65.46%
29DeepSeek V4 Pro 0813DeepSeek · Closedmax reasoning65.42%
30GPT-5.6 TerraOpenAI · Closedxhigh reasoning65.31%
31Claude Sonnet 4.6Anthropic · Closed65.31%
32Qwen3.5 Plus ThinkingAlibaba65.31%
33GPT-5.4OpenAI · Closedxhigh reasoning65.27%
34Muse SparkMeta · Closed65.11%
35Claude Opus 4.5 ThinkingAnthropic · Closed65.07%
36Gemini 3.5 FlashGoogle · Closedhigh reasoning64.69%
37Gemini 3.1 Pro PreviewGooglehigh reasoning64.49%
38GLM-5.1Z.AI · Open weight64.45%
39GPT-5.6 SolOpenAI · Closedmax reasoning64.38%
40GPT-5.6 LunaOpenAI · Closedmax reasoning64.22%
41GPT-5.1OpenAI · Closedhigh reasoning63.83%
42Qwen3.7 MaxAlibaba · Closed63.71%
43Grok 4.20 0309 ReasoningxAI63.67%
44Gemini 3 Pro PreviewGooglehigh reasoning63.67%
45Qwen3.5 FlashAlibaba · Closed63.56%
46Gemini 3.6 FlashGoogle · Closedhigh reasoning63.33%
47GPT-4.1OpenAI · Closedhigh reasoning63.05%
48GLM 5 ThinkingZhipu AI62.90%
49Qwen3.6-27BAlibaba · Open weight62.31%
50Claude Sonnet 4.5 ThinkingAnthropic · Closed61.97%
51Ling 3.0 Flash 2607Ant61.93%
52Qwen3.6 PlusAlibaba · Closed61.93%
53DeepSeek V4 Flash 0731DeepSeek · Closedhigh reasoning61.85%
54MiMo-V2.5-ProXiaomi · Closed61.42%
56Claude Opus 4.5Anthropic · Closed61.30%
57Claude Sonnet 4 20250514 ThinkingAnthropic61.23%
58GPT-5.4 nanoOpenAI · Closedhigh reasoning61.19%
59MiniMax M2.7MiniMax · Open weight61.19%
60Grok 3 Mini Fast High ReasoningxAIhigh reasoning61.11%
61GPT-5OpenAIhigh reasoning61.07%
62Mistral Large 2512Mistral AI61.03%
63GLM-4.5Z.AI · Closed60.96%
64GPT-5.4 miniOpenAI · Closedxhigh reasoning60.92%
65Claude Sonnet 4.5Anthropic · Closed60.80%
66Gemini 2.5 ProGoogle · Closed60.80%
67Gemini 3.5 Flash-LiteGoogle · Closedhigh reasoning60.68%
68Claude Haiku 4.5 ThinkingAnthropic · Closed60.61%
69Kimi K2 ThinkingMoonshot AI60.57%
70Claude 3.7 Sonnet 20250219 ThinkingAnthropic60.41%
71Claude Haiku 4.5Anthropic · Closed60.30%
72GPT-5 miniOpenAI · Closedhigh reasoning60.18%
73MiMo-V2.5Xiaomi · Closed59.91%
74Gemini 2.5 Pro Exp 03 25Google59.83%
75Gemini 2.5 Flash Preview 09 2025 ThinkingGoogle59.75%
76o3OpenAI · Closedhigh reasoning59.71%
77Grok 3xAI59.71%
78MiniMax M2.5MiniMax · Closed59.60%
79Grok 3 Mini Fast Low ReasoningxAIlow reasoning59.48%
80Gemini 3.1 Flash Lite PreviewGooglehigh reasoning59.36%
81O4 MiniOpenAIhigh reasoning58.97%
82Gemini 2.5 Flash Preview 09 2025Google58.97%
83MiniMax M2.1MiniMax58.90%
84Mistral Medium 3.5Mistral AIhigh reasoning58.78%
85Grok 4 Fast Non ReasoningxAI58.39%
86GPT-OSS 120BOpenAI · Open weight58.24%
87Laguna M.1Poolside · Closed58.16%
88GPT-4.1 miniOpenAI · Closedhigh reasoning57.93%
89Gemini 2.5 Flash Lite Preview 09 2025 ThinkingGoogle57.58%
90GLM-4.6Z.AI · Open weight56.84%
91Laguna XS.2Poolside · Open weight56.33%
92Gemini 2.5 Flash Lite Preview 09 2025Google56.29%
94DeepSeek V3 0324Fireworks AI54.74%
95Claude Sonnet 4Anthropic54.70%
96Trinity-Large-ThinkingArcee AI · Open weight54.66%
97Nemotron Lightning 3p5 30b A3bFireworks AI54.23%
98Gemini 2.5 Flash Preview 04 17Google54.16%
99DeepSeek-R1DeepSeek · Open weight54.12%
100Claude 3.5 SonnetAnthropic · Closed53.61%
101GPT-OSS 20BOpenAI · Open weight53.15%
102Qwen3 Max PreviewAlibaba52.95%
103Grok 4.1 Fast Non ReasoningxAI52.49%
104DeepSeek V3DeepSeek · Open weight52.49%
105DeepSeek V3p1Fireworks AI51.48%
106Grok 2 1212xAI51.13%
107DeepSeek V3p2 ThinkingFireworks AIhigh reasoning50.97%
108Claude 3.5 HaikuAnthropic50.82%
109Mistral Medium 2505Mistral AI50.74%
110Moonshotai Kimi K2 InstructTogether AI50.39%
111Llama4 Maverick Instruct BasicFireworks AI49.73%
112DeepSeek V3p2Fireworks AInone reasoning47.94%
113Magistral Medium 2509Mistral AI47.40%
114Meta Llama Llama 4 Scout 17B 16E InstructTogether AI46.78%
115GLM-4.7Z.AI · Open weight46.39%
116Command A 03 2025Cohere45.96%
117GPT-4oOpenAI · Closedhigh reasoning45.92%
118GPT-4o miniOpenAI · Closedhigh reasoning45.45%
119o3-miniOpenAI · Closedhigh reasoning45.30%
120Mistral Small 2503Mistral AI44.17%
121Magistral Small 2509Mistral AI44.02%
122Gemini 2.0 Pro Exp 02 05Google43.44%
123GPT-4.1 nanoOpenAI · Closedhigh reasoning42.08%
124Jamba Large 1.6AI21 Labs41.53%
125Gemini 1.5 Pro 002Google40.52%
127Jamba 1.5 LargeAI21 Labs39.43%
128Meta Llama Meta Llama 3.1 70B Instruct TurboTogether AI38.85%
129Gemini 1.5 Flash 002Google38.19%
130Jamba Mini 1.6AI21 Labs38.03%
131Meta Llama Meta Llama 3.1 8B Instruct TurboTogether AI37.80%
132Jamba 1.5 MiniAI21 Labs33.88%
133Gemini 2.0 Flash 001Google33.72%
134Gemini 1.5 Flash 001Google28.63%