context.vn
Menu

finance Agent V2

62 models evaluated

#ModelProviderTypeScore
1Gemini 3.8 FlashGoogleProprietaryhigh reasoning
2Muse Spark 1.2MetaProprietaryxhigh reasoning
3Metamax reasoningMuse Spark 1.3 Max60.0%
4Gemini 3.7 FlashGoogle · Closedhigh reasoning59.0%
5Muse Spark 1.3Meta · Closedxhigh reasoning58.9%
6Claude Fable 5.1Anthropic · Closed58.9%
7Claude Opus 5Anthropic · Closed58.6%
8Claude Opus 5.5Anthropic · Closed58.6%
9Gemini 3.5 FlashGoogle · Closedhigh reasoning57.9%
10GLM-5.3-FlashZ.AI · Open weightmax reasoning57.9%
11Muse Spark 1.1Meta · Closedxhigh reasoning57.2%
12Claude Fable 5Anthropic · Closed56.3%
13Gemini 3.6 FlashGoogle · Closedhigh reasoning56.3%
14GLM-5.3Z.AI · Open weightmax reasoning55.8%
15Hy4 previewTencent · Open weight55.1%
16GPT-5.6 LunaOpenAI · Closedmax reasoning55.0%
17GPT-5.6 TerraOpenAI · Closedmax reasoning54.4%
18Kimi K3Moonshot AI · Closed54.4%
19Claude Opus 4.8Anthropic · Closed53.9%
20Claude Sonnet 5Anthropic · Closed53.9%
21GPT-5.6 SolOpenAI · Closedmax reasoning53.8%
22Grok 4.6xAI · Closedhigh reasoning53.7%
23GPT-6 AstraOpenAI · Closedmax reasoning53.5%
24DeepSeek V4.1 FlashDeepSeek · Open weighthigh reasoning53.5%
25Grok 4.7xAI · Closedxhigh reasoning52.3%
26GPT-5.5OpenAI · Closedxhigh reasoning51.8%
27Claude Opus 4.7Anthropic · Closed51.5%
28Claude Sonnet 4.6Anthropic · Closed51.0%
29Qwen3.8 MaxAlibaba · Open weight50.6%
30DeepSeek V4 Pro 0813DeepSeek · Closedmax reasoning50.4%
31GLM-5.2Z.AI · Open weight49.7%
32DeepSeek V4 Flash 0731DeepSeek · Closedhigh reasoning49.5%
33Qwen3.8-27BAlibaba · Open weightxhigh reasoning48.6%
34Grok 4.5xAI · Closedhigh reasoning48.3%
35MiniMax M3MiniMax · Open weight48.3%
36Qwen3.7 MaxAlibaba · Closed47.8%
37Gemini 3.5 Flash-LiteGoogle · Closedhigh reasoning47.4%
38InklingThinking Machines Lab · Open weight0.99 reasoning46.6%
39GPT-5.4 miniOpenAI · Closedxhigh reasoning45.4%
40Kimi K2.6Moonshot AI · Open weight44.9%
41GLM-5.1Z.AI · Open weight44.8%
43Gemini 3.1 Pro PreviewGooglehigh reasoning43.0%
44Gemini 3 Flash PreviewGooglehigh reasoning42.6%
45MiMo-V2.5-ProXiaomi · Closed41.5%
46Inkling-SmallThinking Machines Lab · Open weight0.99 reasoning41.3%
47Qwen3.6 PlusAlibaba · Closed40.8%
48Qwen3.7 PlusAlibaba · Closed38.2%
49GPT-5.4 nanoOpenAI · Closedhigh reasoning38.2%
50Grok 4.3xAI · Closedhigh reasoning37.7%
51Nemotron 3 Ultra 550b A55bNvidia37.7%
52MiMo-V2.5Xiaomi · Closed36.7%
53Kimi K2.5 ThinkingMoonshot AI35.8%
54Mistral Medium 3.5Mistral AIhigh reasoning32.1%
55Claude Haiku 4.5 ThinkingAnthropic · Closed31.0%
56Ling 3.0 Flash 2607Ant30.3%
57Gemini 3.1 Flash Lite PreviewGooglehigh reasoning30.0%
58Grok 4.20 0309 ReasoningxAI28.5%
59MiniMax M2.7MiniMax · Open weight27.9%
60Laguna M.1Poolside · Closed25.0%
61Mercury 2.5Inception · Closedhigh reasoning18.6%
62Nemotron Lightning 3p5 30b A3bFireworks AI18.5%
63Laguna XS.2Poolside · Open weight15.6%