context.vn

finance Agent V2

40 models evaluated

#ModelProviderTypeScore
1Anthropicanthropic/claude-opus-5Claude Opus 558.6%
2Googlegoogle/gemini-3.5-flashGemini 3.5 Flash57.9%
3Metameta/muse_spark_1_1Muse Spark 1.157.2%
4Claude Fable 5Anthropic56.3%
5Gemini 3.6 FlashGoogle56.3%
6GPT-5.6 LunaOpenAI55.0%
7Kimi K3Moonshot AI54.4%
8Claude Opus 4.8Anthropic53.9%
9Claude Sonnet 5Anthropic53.9%
10GPT-5.6 SolOpenAI53.8%
11GPT-5.6 TerraOpenAI52.4%
12GPT-5.5OpenAI51.8%
13Claude Opus 4.7Anthropic51.5%
14Claude Sonnet 4.6Anthropic51.0%
15GLM 5.2Zhipu AI49.7%
16Grok 4.5xAI48.3%
17MiniMax M3MiniMax48.3%
18Qwen3.7 MaxAlibaba47.8%
19Gemini 3.5 Flash LiteGoogle47.4%
20InklingThinkingmachines46.6%
21GPT-5.4 MiniOpenAI45.4%
22Kimi K2.6Moonshot AI44.9%
23GLM 5.1Zhipu AI44.8%
24DeepSeek V4 ProDeepSeek44.1%
25Gemini 3.1 Pro PreviewGoogle43.0%
26Gemini 3 Flash PreviewGoogle42.6%
27Mimo V2.5 ProXiaomi41.5%
28Qwen3.6 PlusAlibaba40.8%
29Qwen3.7 PlusAlibaba38.2%
30GPT-5.4 NanoOpenAI38.2%
31Grok 4.3xAI37.7%
32Nemotron 3 Ultra 550b A55bNvidia37.7%
33Mimo V2.5Xiaomi36.7%
34Mistral Medium 3.5Mistral AI32.1%
35Claude Haiku 4.5 20251001 ThinkingAnthropic31.0%
36Gemini 3.1 Flash Lite PreviewGoogle30.0%
37Grok 4.20 0309 ReasoningxAI28.5%
38MiniMax M2.7MiniMax27.9%
39Laguna M.1Poolside25.0%
40Laguna Xs.2Poolside15.6%