context.vn
Menu

vals Terminal Bench2

66 models evaluated

#ModelProviderTypeScore
1GPT-5.5OpenAIProprietaryhigh reasoning
2Claude Opus 4.8AnthropicProprietary70.04%
3Claude Opus 4.7AnthropicProprietary68.54%
4Gemini 3.5 FlashGoogle · Closedhigh reasoning67.42%
5Gemini 3.1 Pro PreviewGooglehigh reasoning67.42%
6GPT-5.3 CodexOpenAI · Closedhigh reasoning64.05%
7Muse SparkMeta · Closed59.55%
8Claude Sonnet 4.6Anthropic · Closed59.55%
9Qwen3.7 MaxAlibaba · Closed59.18%
10Claude Opus 4.5Anthropic · Closed58.43%
11Claude Opus 4.6 (Adaptive)Anthropic · Closed58.43%
12GPT-5.4OpenAI · Closedhigh reasoning58.43%
13Kimi K2.6Moonshot AI · Open weight57.30%
14DeepSeek V4 Pro 0813DeepSeek · Closed56.18%
15Gemini 3 Pro PreviewGooglehigh reasoning55.06%
16Claude Opus 4.5 ThinkingAnthropic · Closed53.93%
17GLM-5.1Z.AI · Open weight53.93%
18Gemini 3 Flash PreviewGooglehigh reasoning51.69%
19GPT-5.2OpenAI · Closedhigh reasoning51.69%
20Qwen 3.6 Max (preview)Alibaba · Closed51.69%
21GLM 5 ThinkingZhipu AI49.44%
22MiniMax M2.7MiniMax · Open weight47.19%
23MiniMax M3MiniMax · Open weight46.07%
24Qwen3.6 PlusAlibaba · Closed44.94%
25GPT-5.1OpenAI · Closedhigh reasoning44.94%
26Qwen3.6-27BAlibaba · Open weight44.94%
27GPT-5.4 miniOpenAI · Closedhigh reasoning44.94%
28Grok 4.3xAI · Closed43.45%
29Claude Sonnet 4.5 ThinkingAnthropic · Closed41.57%
30MiniMax M2.5MiniMax · Closed41.57%
31Qwen3.5 Plus ThinkingAlibaba41.57%
32Grok 4.20 0309 ReasoningxAI40.45%
33Kimi K2.5 ThinkingMoonshot AI40.45%
34GPT-5.4 nanoOpenAI · Closedhigh reasoning39.89%
35Gemma 4 31b ItGooglehigh reasoning39.33%
36Claude Haiku 4.5 ThinkingAnthropic · Closed38.20%
37GLM-4.7Z.AI · Open weight38.20%
38MiniMax M2.1MiniMax37.08%
39GPT-5OpenAIhigh reasoning37.08%
40Kimi K2 ThinkingMoonshot AI37.08%
41DeepSeek V3p2 ThinkingFireworks AIhigh reasoning35.95%
42DeepSeek V3p2Fireworks AInone reasoning34.83%
43Laguna M.1Poolside · Closed31.46%
44Gemini 2.5 ProGoogle · Closed30.34%
45Mistral Medium 3.5Mistral AIhigh reasoning30.34%
46Grok 4 Fast (Reasoning)xAI · Closed29.21%
47Laguna XS.2Poolside · Open weight28.09%
48GLM-4.6Z.AI · Open weight28.09%
49Grok 4 0709xAI28.09%
50GPT-5 miniOpenAI · Closedhigh reasoning26.97%
51Moonshotai Kimi K2 InstructTogether AI25.84%
52Grok 4.1 Fast (Reasoning)xAI · Closed24.72%
53Gemini 3.1 Flash Lite PreviewGooglehigh reasoning24.72%
54Qwen3.5 FlashAlibaba · Closed24.72%
55Qwen3 MaxAlibaba · Closed24.72%
56DeepSeek V3p1Fireworks AI22.47%
57Gemini 2.5 Flash Preview 09 2025 ThinkingGoogle21.35%
59GPT-OSS 120BOpenAI · Open weight19.10%
60Grok 4.1 Fast Non ReasoningxAI17.98%
61Trinity-Large-ThinkingArcee AI · Open weight17.98%
62Mistral Small 2603Mistral AIhigh reasoning16.85%
63GPT-4.1OpenAI · Closedhigh reasoning14.61%
64Magistral Medium 2509Mistral AI13.48%
65Mistral Large 2512Mistral AI8.99%
66Command A 03 2025Cohere2.25%
67Llama4 Maverick Instruct BasicFireworks AI2.25%