context.vn
Menu

vals Mortgage Tax

97 models evaluated

#ModelProviderTypeScore
1Claude Opus 5AnthropicProprietary72.06%
2Claude Fable 5.1AnthropicProprietary70.79%
3Claude Opus 4.7AnthropicProprietary70.27%
4Claude Sonnet 5Anthropic · Closed70.03%
5Claude Opus 4.8Anthropic · Closed69.91%
6Gemini 3.1 Pro PreviewGooglehigh reasoning69.40%
7Gemini 3 Pro PreviewGooglehigh reasoning69.08%
8Claude Fable 5Anthropic · Closed68.92%
9Gemini 2.5 ProGoogle · Closed68.92%
10GPT-5.5OpenAI · Closedxhigh reasoning68.76%
11Gemini 3 Flash PreviewGooglehigh reasoning68.72%
12Gemini 3.5 Flash-LiteGoogle · Closedhigh reasoning68.68%
13Claude 3.7 SonnetAnthropic68.68%
14Claude Opus 4.5Anthropic · Closed68.68%
15Claude Opus 4.6 (Adaptive)Anthropic · Closed68.52%
16MiniMax M3MiniMax · Open weight68.36%
17GPT-5.4OpenAI · Closedxhigh reasoning68.32%
18Qwen3.6-27BAlibaba · Open weight68.28%
19Gemini 3.5 FlashGoogle · Closedhigh reasoning68.12%
20Gemini 3.1 Flash Lite PreviewGooglehigh reasoning68.04%
21Qwen3.6 PlusAlibaba · Closed67.97%
22Claude Sonnet 4.6Anthropic · Closed67.73%
23Claude Opus 4.5 ThinkingAnthropic · Closed67.69%
24Gemini 3.6 FlashGoogle · Closedhigh reasoning67.61%
25Qwen3.5 FlashAlibaba · Closed67.37%
26GPT-5.6 TerraOpenAI · Closedxhigh reasoning67.33%
27GPT-5.6 LunaOpenAI · Closedmax reasoning67.29%
28GPT-5.6 SolOpenAI · Closedmax reasoning67.29%
29Gemini 2.5 Pro Exp 03 25Google67.17%
30GPT-5.2OpenAI · Closedxhigh reasoning67.13%
31GPT-5 miniOpenAI · Closedhigh reasoning66.89%
32Claude 3.7 Sonnet 20250219 ThinkingAnthropic66.85%
33Gemini 3.7 FlashGoogle · Closedhigh reasoning66.65%
34Kimi K2.5 ThinkingMoonshot AI66.53%
35Kimi K3Moonshot AI · Closed66.34%
36Qwen3.7 PlusAlibaba · Closed66.18%
37Muse Spark 1.1Meta · Closedxhigh reasoning66.14%
38GPT-4.1OpenAI · Closedhigh reasoning65.94%
39Kimi K2.6Moonshot AI · Open weight65.82%
40o3OpenAI · Closedhigh reasoning65.70%
41GPT-4.1 miniOpenAI · Closedhigh reasoning65.50%
42GPT-5OpenAIhigh reasoning65.45%
43Muse Spark 1.2Meta · Closedxhigh reasoning65.42%
44Gemini 3.8 FlashGoogle · Closedhigh reasoning65.34%
45Qwen3.8-27BAlibaba · Open weightxhigh reasoning64.94%
46O4 MiniOpenAIhigh reasoning64.83%
47Grok 4.6xAI · Closedhigh reasoning64.19%
48Claude 3.5 SonnetAnthropic · Closed64.07%
49Qwen3.8 MaxAlibaba · Open weight63.99%
50Claude Sonnet 4.5 ThinkingAnthropic · Closed63.99%
51InklingThinking Machines Lab · Open weight0.99 reasoning63.99%
52GPT-5.4 miniOpenAI · Closedxhigh reasoning63.51%
53Gemini 2.5 Flash Preview 09 2025Google62.60%
54Claude Sonnet 4Anthropic62.47%
55Inkling-SmallThinking Machines Lab · Open weight0.99 reasoning62.28%
56Claude Haiku 4.5 ThinkingAnthropic · Closed62.16%
57Magistral Small 2509Mistral AI62.12%
58Gemini 2.5 Flash Preview 09 2025 ThinkingGoogle61.92%
59Grok 4.5xAI · Closedhigh reasoning61.80%
60Gemma 4 31b ItGooglehigh reasoning61.37%
61GPT-5.1OpenAI · Closedhigh reasoning61.37%
62Mistral Small 2503Mistral AI61.21%
63Claude Opus 4.1Anthropic61.09%
64GPT-4oOpenAI · Closedhigh reasoning60.97%
65Qwen3.5 Plus ThinkingAlibaba60.77%
66Gemini 2.0 Flash ExpGoogle60.37%
67Gemini 2.0 Flash 001Google59.66%
68MiMo-V2.5Xiaomi · Closed59.26%
69GPT-5.4 nanoOpenAI · Closedhigh reasoning59.10%
70Claude Opus 4Anthropic58.59%
71Llama4 Maverick Instruct BasicFireworks AI58.51%
72Gemini 2.5 Flash Preview 04 17Google58.43%
73Meta Llama Llama 4 Scout 17B 16E InstructTogether AI57.75%
74Gemini 2.5 Flash Lite Preview 09 2025 ThinkingGoogle57.55%
75Gemini 2.5 Flash Preview 04 17 ThinkingGoogle57.51%
77Gemini 1.5 Pro 002Google56.76%
78Claude Opus 4.1 20250805 ThinkingAnthropic56.12%
79Gemini 2.5 Flash Lite Preview 09 2025Google55.80%
80GPT-4o miniOpenAI · Closedhigh reasoning54.49%
81GPT-5 nanoOpenAI · Closedhigh reasoning53.62%
82GPT-4.1 nanoOpenAI · Closedhigh reasoning52.82%
83Mistral Large 2512Mistral AI52.11%
84Magistral Medium 2509Mistral AI51.87%
85Claude Sonnet 4 20250514 ThinkingAnthropic49.88%
86Grok 4.3xAI · Closed48.25%
87Grok 4.20 0309 ReasoningxAI45.35%
88Grok 4 0709xAI44.48%
89Gemini 1.5 Flash 002Google42.77%
90Grok 4.1 Fast (Reasoning)xAI · Closed42.61%
91Grok 4 Fast (Reasoning)xAI · Closed42.09%
92Meta Llama Llama 3.2 90B Vision Instruct TurboTogether AI38.79%
93Mistral Medium 2505Mistral AI36.45%
94Grok 4.1 Fast Non ReasoningxAI34.26%
95Mistral Medium 3.5Mistral AIhigh reasoning28.89%
96Grok 4 Fast Non ReasoningxAI25.32%
97Meta Llama Llama 3.2 11B Vision Instruct TurboTogether AI23.29%
98Grok 2 Vision 1212xAI3.46%