context.vn

vals Legal Bench

129 models evaluated

#ModelProviderTypeScore
1Anthropicanthropic/claude-fable-5Claude Fable 588.56%
2Googlegoogle/gemini-3.1-pro-previewGemini 3.1 Pro Preview87.40%
3Googlegoogle/gemini-3-pro-previewGemini 3 Pro Preview87.03%
4Claude Opus 5Anthropic86.97%
5GPT-5.6 SolOpenAI86.97%
6Gemini 3 Flash PreviewGoogle86.86%
7Gemini 3.6 FlashGoogle86.70%
8GPT-5.5OpenAI86.52%
9GPT-5.4OpenAI86.04%
10GPT-5OpenAI86.02%
11Kimi K3Moonshot AI86.02%
12Grok 4.5xAI85.97%
13GPT-5.1OpenAI85.68%
14MiniMax M3MiniMax85.42%
15Claude Opus 4.6 ThinkingAnthropic85.30%
16Claude Opus 4.7Anthropic85.25%
17GPT-5.6 TerraOpenAI85.11%
18Qwen3.5 Plus ThinkingAlibaba85.10%
19Muse Spark 1.1Meta84.98%
20Qwen3.7 MaxAlibaba84.91%
21Kimi K2.6Moonshot AI84.74%
22Claude Opus 4.5 20251101 ThinkingAnthropic84.60%
23Grok 4.3xAI84.46%
24GLM 5.1Zhipu AI84.39%
25Gemini 2.5 Pro Exp 03 25Google84.32%
26Qwen3.5 FlashAlibaba84.28%
27Qwen3.6 PlusAlibaba84.23%
28Muse SparkMeta84.22%
29Claude Sonnet 4.5 20250929 ThinkingAnthropic84.08%
30Gemini 3.5 Flash LiteGoogle84.07%
31GLM 5.2Zhipu AI84.07%
32GLM 5 ThinkingZhipu AI84.06%
33GPT-5.6 LunaOpenAI84.03%
34MiniMax M2.7MiniMax83.98%
35Claude Sonnet 5Anthropic83.92%
36Gemini 2.5 Flash Preview 04 17Google83.80%
37Gemini 3.1 Flash Lite PreviewGoogle83.76%
38O3OpenAI83.76%
39Gemini 3.5 FlashGoogle83.60%
40Claude Opus 4.8Anthropic83.57%
41Claude Opus 4.1Anthropic83.46%
42GLM 4.7Zhipu AI83.36%
43Grok 4 0709xAI83.19%
44Grok 3 Mini Fast High ReasoningxAI83.14%
45GPT-4.1OpenAI83.10%
46Claude Opus 4Anthropic83.07%
47Claude Sonnet 4Anthropic82.95%
48InklingThinkingmachines82.95%
49Claude Opus 4.5Anthropic82.84%
50GPT-5.2OpenAI82.76%
51Gemini 2.5 Flash Preview 09 2025 ThinkingGoogle82.63%
52Grok 3xAI82.59%
53Claude 3.7 Sonnet 20250219 ThinkingAnthropic82.52%
54Gemini 2.5 Flash Preview 09 2025Google82.49%
55Grok 4.1 Fast ReasoningxAI82.45%
56GPT-4oOpenAI82.21%
57Claude Sonnet 4.6Anthropic82.12%
58Nemotron 3 Ultra 550b A55bNvidia82.07%
59Claude Sonnet 4 20250514 ThinkingAnthropic82.06%
60Gemini 2.5 Flash Lite Preview 09 2025 ThinkingGoogle82.04%
61Grok 3 Mini Fast Low ReasoningxAI81.92%
62Qwen3 MaxAlibaba81.86%
63GPT-5 MiniOpenAI81.77%
64Moonshotai Kimi K2 InstructTogether AI81.45%
65Claude Haiku 4.5 20251001 ThinkingAnthropic81.24%
66DeepSeek V3Fireworks AI80.76%
67Grok 4 Fast ReasoningxAI80.60%
68GPT-4 TurboOpenAI80.46%
69O1OpenAI80.39%
70Qwen3 Max PreviewAlibaba80.33%
71DeepSeek V4 ProDeepSeek80.32%
72Kimi K2 ThinkingMoonshot AI80.20%
73Qwen3 235b A22bFireworks AI80.18%
74GPT-4oOpenAI80.12%
75Claude 3.7 SonnetAnthropic80.00%
76MiniMax M2.5MiniMax79.96%
77Command A 03 2025Cohere79.70%
78GLM 4.6Zhipu AI79.61%
79Qwen Qwen2.5 72B Instruct TurboTogether AI79.40%
80O4 MiniOpenAI79.19%
81Mistral Large 2512Mistral AI79.14%
82Grok 4.1 Fast Non ReasoningxAI79.11%
83Gemini 2.5 Flash Lite Preview 09 2025Google79.01%
84Mimo V2.5Xiaomi78.89%
85Grok 4 Fast Non ReasoningxAI78.40%
86Gemini 2.0 Flash 001Google78.36%
87GPT-4.1 MiniOpenAI78.04%
88GPT-5.4 NanoOpenAI77.92%
89Llama4 Maverick Instruct BasicFireworks AI77.81%
90Grok 4.20 0309 ReasoningxAI77.74%
91DeepSeek V3 0324Fireworks AI77.73%
92Meta Llama Llama 3.3 70B Instruct TurboTogether AI77.18%
93Mimo V2.5 ProXiaomi77.13%
94DeepSeek V3p2 ThinkingFireworks AI76.08%
95GPT Oss 120bFireworks AI75.94%
96GLM 4.5Zhipu AI75.63%
97MiniMax M2.1MiniMax75.45%
98Laguna M.1Poolside75.14%
99Jamba 1.5 LargeAI21 Labs74.16%
100Meta Llama Llama 4 Scout 17B 16E InstructTogether AI72.04%
101Jamba Large 1.6AI21 Labs71.96%
102O3 MiniOpenAI71.54%
103Laguna Xs.2Poolside71.03%
104GPT Oss 20bFireworks AI70.85%
105Claude 3.5 HaikuAnthropic70.33%
106Gemini 1.0 Pro 002Google70.25%
107Jamba Mini 1.6AI21 Labs69.73%
108Qwen Qwen2.5 7B Instruct TurboTogether AI69.56%
109Mistral Small 2503Mistral AI69.16%
110Gemini 1.5 Pro 002Google69.08%
111Command R PlusCohere68.29%
112Google Gemma 2 9b ItTogether AI68.14%
113Google Gemma 2 27b ItTogether AI67.98%
114DeepSeek R1Fireworks AI67.32%
115Jamba 1.5 MiniAI21 Labs66.62%
116DeepSeek V3p2Fireworks AI65.96%
117GPT-3.5 TurboOpenAI64.37%
118Gemini 1.5 Flash 002Google63.24%
119Meta Llama Llama 2 70b HfTogether AI62.43%
120Mistral Medium 2505Mistral AI61.98%
121GPT-4.1 NanoOpenAI61.06%
122Mistralai Mixtral 8x7B V0.1Together AI55.84%
123Magistral Medium 2509Mistral AI54.77%
124Mistralai Mistral 7B V0.1Together AI53.77%
125Togethercomputer Llama 2 13bTogether AI53.70%
126Togethercomputer Llama 2 7bTogether AI51.87%
127GPT-5 NanoOpenAI50.13%
128Magistral Small 2509Mistral AI40.02%
129Command RCohere32.97%