context.vn

vals Case Law V2

54 models evaluated

#ModelProviderTypeScore
1xAIgrok/grok-4.3Grok 4.379.31%
2OpenAIopenai/gpt-5.1-2025-11-13GPT-5.173.42%
3OpenAIopenai/gpt-4.1-2025-04-14GPT-4.169.88%
4GPT-5 MiniOpenAI68.49%
5Claude Opus 4.7Anthropic68.38%
6GPT-5OpenAI66.45%
7GPT-5.5OpenAI66.24%
8GPT-5.2OpenAI66.02%
9Grok 4 0709xAI65.81%
10Grok 4 Fast ReasoningxAI65.70%
11Kimi K2 ThinkingMoonshot AI65.70%
12Gemini 3.1 Pro PreviewGoogle64.84%
13Command A 03 2025Cohere64.52%
14Claude Sonnet 4.6Anthropic63.99%
15Gemini 2.5 ProGoogle63.88%
16GPT-5.4OpenAI63.77%
17Muse SparkMeta63.13%
18Claude Opus 4.5 20251101 ThinkingAnthropic62.59%
19Claude Sonnet 4.5 20250929 ThinkingAnthropic62.16%
20Claude Opus 4.6 ThinkingAnthropic62.06%
21Mistral Large 2512Mistral AI61.41%
22Kimi K2.6Moonshot AI61.20%
23MiniMax M2.7MiniMax60.88%
24Grok 4.1 Fast ReasoningxAI60.45%
25GPT-4oOpenAI59.70%
26Qwen3.5 Plus ThinkingAlibaba59.70%
27DeepSeek V4 ProDeepSeek59.38%
28Kimi K2.5 ThinkingMoonshot AI58.73%
29Trinity Large ThinkingArcee-Ai57.88%
30Claude Haiku 4.5 20251001 ThinkingAnthropic56.48%
31Qwen3.5 FlashAlibaba55.95%
32MiniMax M2.1MiniMax55.84%
33Gemini 3 Flash PreviewGoogle55.84%
34DeepSeek V3p2 ThinkingFireworks AI55.41%
35Gemini 3.1 Flash Lite PreviewGoogle54.98%
36Qwen3 MaxAlibaba54.98%
37GLM 4.7Zhipu AI54.88%
38Grok 4.20 0309 ReasoningxAI54.45%
39DeepSeek V3p1Fireworks AI53.91%
40MiniMax M2.5MiniMax53.48%
41Qwen3.6 27bAlibaba53.16%
42Gemini 3 Pro PreviewGoogle53.05%
43Gemma 4 31b ItGoogle52.63%
44GPT-5 NanoOpenAI52.63%
45GLM 5 ThinkingZhipu AI52.52%
46GPT-5.4 NanoOpenAI51.88%
47GPT-5.4 MiniOpenAI51.66%
48GLM 5.1Zhipu AI51.55%
49Qwen3.6 PlusAlibaba51.45%
50GPT Oss 120bFireworks AI48.77%
51Qwen3.6 Max PreviewAlibaba47.91%
52Qwen3 MaxAlibaba47.48%
53Mistral Medium 3.5Mistral AI44.16%
54GPT Oss 20bFireworks AI43.84%