context.vn
Menu

vals Legal Bench

144 models evaluated

#ModelProviderTypeScore
1Claude Fable 5AnthropicProprietary88.56%
2Claude Fable 5.1AnthropicProprietary88.51%
3Googlehigh reasoningGemini 3.1 Pro Preview87.40%
4Gemini 3.7 FlashGoogle · Closedhigh reasoning87.26%
5Gemini 3 Pro PreviewGooglehigh reasoning87.03%
6Gemini 3.8 FlashGoogle · Closedhigh reasoning86.99%
7Claude Opus 5Anthropic · Closed86.97%
8GPT-5.6 SolOpenAI · Closedmax reasoning86.97%
9Gemini 3 Flash PreviewGooglehigh reasoning86.86%
10Gemini 3.6 FlashGoogle · Closedhigh reasoning86.70%
11GPT-5.5OpenAI · Closedxhigh reasoning86.52%
12Grok 4.6xAI · Closedhigh reasoning86.31%
13GPT-5.4OpenAI · Closedxhigh reasoning86.04%
14GPT-5OpenAIhigh reasoning86.02%
15Kimi K3Moonshot AI · Closed86.02%
16Grok 4.5xAI · Closedhigh reasoning85.97%
17GPT-5.1OpenAI · Closedhigh reasoning85.68%
18MiniMax M3MiniMax · Open weight85.42%
19Claude Opus 4.6 (Adaptive)Anthropic · Closed85.30%
20Muse Spark 1.2Meta · Closedxhigh reasoning85.26%
21Claude Opus 4.7Anthropic · Closed85.25%
22GPT-5.6 TerraOpenAI · Closedmax reasoning85.11%
23Qwen3.5 Plus ThinkingAlibaba85.10%
24Muse Spark 1.1Meta · Closedxhigh reasoning84.98%
25Qwen3.7 MaxAlibaba · Closed84.91%
26GLM-5.3Z.AI · Open weightmax reasoning84.84%
27Kimi K2.6Moonshot AI · Open weight84.74%
28Claude Opus 4.5 ThinkingAnthropic · Closed84.60%
29Grok 4.3xAI · Closed84.46%
30GLM-5.1Z.AI · Open weight84.39%
31Grok 4.7xAI · Closedxhigh reasoning84.39%
32Gemini 2.5 Pro Exp 03 25Google84.32%
33Qwen3.5 FlashAlibaba · Closed84.28%
34Qwen3.6 PlusAlibaba · Closed84.23%
35Muse SparkMeta · Closed84.22%
36Claude Sonnet 4.5 ThinkingAnthropic · Closed84.08%
37Gemini 3.5 Flash-LiteGoogle · Closedhigh reasoning84.07%
38GLM-5.2Z.AI · Open weight84.07%
39GLM 5 ThinkingZhipu AI84.06%
40GPT-5.6 LunaOpenAI · Closedmax reasoning84.03%
41MiniMax M2.7MiniMax · Open weight83.98%
42GLM-5.3-FlashZ.AI · Open weightmax reasoning83.93%
43Claude Sonnet 5Anthropic · Closed83.92%
44Gemini 2.5 Flash Preview 04 17Google83.80%
45Gemini 3.1 Flash Lite PreviewGooglehigh reasoning83.76%
46o3OpenAI · Closedhigh reasoning83.76%
47Hy4 previewTencent · Open weight83.76%
48Qwen3.8 MaxAlibaba · Open weight83.61%
49Gemini 3.5 FlashGoogle · Closedhigh reasoning83.60%
50Claude Opus 4.8Anthropic · Closed83.57%
51Claude Opus 4.1Anthropic83.46%
52GLM-4.7Z.AI · Open weight83.36%
53DeepSeek V4.1 FlashDeepSeek · Open weighthigh reasoning83.28%
54Grok 4 0709xAI83.19%
55Grok 3 Mini Fast High ReasoningxAIhigh reasoning83.14%
56GPT-4.1OpenAI · Closedhigh reasoning83.10%
57Claude Opus 4Anthropic83.07%
58Mercury 2.5Inception · Closedhigh reasoning83.06%
59Inkling-SmallThinking Machines Lab · Open weight0.99 reasoning82.99%
60Claude Sonnet 4Anthropic82.95%
61InklingThinking Machines Lab · Open weight0.99 reasoning82.95%
62Claude Opus 4.5Anthropic · Closed82.84%
63GPT-5.2OpenAI · Closedxhigh reasoning82.76%
64Gemini 2.5 Flash Preview 09 2025 ThinkingGoogle82.63%
65Grok 3xAI82.59%
66Claude 3.7 Sonnet 20250219 ThinkingAnthropic82.52%
67Gemini 2.5 Flash Preview 09 2025Google82.49%
68Grok 4.1 Fast (Reasoning)xAI · Closed82.45%
69Qwen3.8-27BAlibaba · Open weightxhigh reasoning82.43%
70DeepSeek V4 Pro 0813DeepSeek · Closedmax reasoning82.36%
71GPT-4oOpenAI · Closedhigh reasoning82.21%
72Claude Sonnet 4.6Anthropic · Closed82.12%
73Nemotron 3 Ultra 550b A55bNvidia82.07%
74Claude Sonnet 4 20250514 ThinkingAnthropic82.06%
75Gemini 2.5 Flash Lite Preview 09 2025 ThinkingGoogle82.04%
76Grok 3 Mini Fast Low ReasoningxAIlow reasoning81.92%
77Qwen3 MaxAlibaba · Closed81.86%
78GPT-5 miniOpenAI · Closedhigh reasoning81.77%
79Moonshotai Kimi K2 InstructTogether AI81.45%
80Claude Haiku 4.5 ThinkingAnthropic · Closed81.24%
81DeepSeek V3DeepSeek · Open weight80.76%
82Grok 4 Fast (Reasoning)xAI · Closed80.60%
83GPT-4 TurboOpenAI · Closedhigh reasoning80.46%
84o1OpenAI · Closedhigh reasoning80.39%
85Qwen3 Max PreviewAlibaba80.33%
87Kimi K2 ThinkingMoonshot AI80.20%
88Qwen3 235b A22bFireworks AI80.18%
90Claude 3.7 SonnetAnthropic80.00%
91MiniMax M2.5MiniMax · Closed79.96%
92Command A 03 2025Cohere79.70%
93Ling 3.0 Flash 2607Ant79.69%
94GLM-4.6Z.AI · Open weight79.61%
95Qwen Qwen2.5 72B Instruct TurboTogether AI79.40%
96O4 MiniOpenAIhigh reasoning79.19%
97Mistral Large 2512Mistral AI79.14%
98Grok 4.1 Fast Non ReasoningxAI79.11%
99Gemini 2.5 Flash Lite Preview 09 2025Google79.01%
100MiMo-V2.5Xiaomi · Closed78.89%
101Grok 4 Fast Non ReasoningxAI78.40%
102Gemini 2.0 Flash 001Google78.36%
103GPT-4.1 miniOpenAI · Closedhigh reasoning78.04%
104GPT-5.4 nanoOpenAI · Closedhigh reasoning77.92%
105Llama4 Maverick Instruct BasicFireworks AI77.81%
106Grok 4.20 0309 ReasoningxAI77.74%
107DeepSeek V3 0324Fireworks AI77.73%
108DeepSeek V4 Flash 0731DeepSeek · Closedhigh reasoning77.71%
109Meta Llama Llama 3.3 70B Instruct TurboTogether AI77.18%
110MiMo-V2.5-ProXiaomi · Closed77.13%
111DeepSeek V3p2 ThinkingFireworks AI76.08%
112GPT-OSS 120BOpenAI · Open weight75.94%
113GLM-4.5Z.AI · Closed75.63%
114MiniMax M2.1MiniMax75.45%
115Laguna M.1Poolside · Closed75.14%
116Jamba 1.5 LargeAI21 Labs74.16%
117Meta Llama Llama 4 Scout 17B 16E InstructTogether AI72.04%
118Jamba Large 1.6AI21 Labs71.96%
119o3-miniOpenAI · Closedhigh reasoning71.54%
120Laguna XS.2Poolside · Open weight71.03%
121GPT-OSS 20BOpenAI · Open weight70.85%
122Claude 3.5 HaikuAnthropic70.33%
123Gemini 1.0 Pro 002Google70.25%
124Jamba Mini 1.6AI21 Labs69.73%
125Qwen Qwen2.5 7B Instruct TurboTogether AI69.56%
126Mistral Small 2503Mistral AI69.16%
127Gemini 1.5 Pro 002Google69.08%
128Command R PlusCohere68.29%
129Google Gemma 2 9b ItTogether AI68.14%
130Google Gemma 2 27b ItTogether AI67.98%
131DeepSeek-R1DeepSeek · Open weight67.32%
132Jamba 1.5 MiniAI21 Labs66.62%
133DeepSeek V3p2Fireworks AI65.96%
134GPT-3.5 TurboOpenAIhigh reasoning64.37%
135Gemini 1.5 Flash 002Google63.24%
136Meta Llama Llama 2 70b HfTogether AI62.43%
137Mistral Medium 2505Mistral AI61.98%
138GPT-4.1 nanoOpenAI · Closedhigh reasoning61.06%
139Mistralai Mixtral 8x7B V0.1Together AI55.84%
140Magistral Medium 2509Mistral AI54.77%
141Mistralai Mistral 7B V0.1Together AI53.77%
142Togethercomputer Llama 2 13bTogether AI53.70%
143Togethercomputer Llama 2 7bTogether AI51.87%
144GPT-5 nanoOpenAI · Closedhigh reasoning50.13%
145Magistral Small 2509Mistral AI40.02%
146Command RCohere32.97%