context.vn

vals Terminal Bench2

67 models evaluated

#ModelProviderTypeScore
1OpenAIopenai/gpt-5.5GPT-5.573.20%
2Anthropicanthropic/claude-opus-4-8Claude Opus 4.870.04%
3Anthropicanthropic/claude-opus-4-7Claude Opus 4.768.54%
4Gemini 3.5 FlashGoogle67.42%
5Gemini 3.1 Pro PreviewGoogle67.42%
6GPT-5.3 CodexOpenAI64.05%
7Muse SparkMeta59.55%
8Claude Sonnet 4.6Anthropic59.55%
9Qwen3.7 MaxAlibaba59.18%
10Claude Opus 4.5Anthropic58.43%
11Claude Opus 4.6 ThinkingAnthropic58.43%
12GPT-5.4OpenAI58.43%
13Kimi K2.6Moonshot AI57.30%
14DeepSeek V4 ProDeepSeek56.18%
15Gemini 3 Pro PreviewGoogle55.06%
16Claude Opus 4.5 20251101 ThinkingAnthropic53.93%
17GLM 5.1Zhipu AI53.93%
18Gemini 3 Flash PreviewGoogle51.69%
19GPT-5.2OpenAI51.69%
20Qwen3.6 Max PreviewAlibaba51.69%
21GLM 5 ThinkingZhipu AI49.44%
22MiniMax M2.7MiniMax47.19%
23MiniMax M3MiniMax46.07%
24Qwen3.6 PlusAlibaba44.94%
25GPT-5.1OpenAI44.94%
26Qwen3.6 27bAlibaba44.94%
27GPT-5.4 MiniOpenAI44.94%
28Grok 4.3xAI43.45%
29Claude Sonnet 4.5 20250929 ThinkingAnthropic41.57%
30MiniMax M2.5MiniMax41.57%
31Qwen3.5 Plus ThinkingAlibaba41.57%
32Grok 4.20 0309 ReasoningxAI40.45%
33Kimi K2.5 ThinkingMoonshot AI40.45%
34GPT-5.4 NanoOpenAI39.89%
35Gemma 4 31b ItGoogle39.33%
36Claude Haiku 4.5 20251001 ThinkingAnthropic38.20%
37GLM 4.7Zhipu AI38.20%
38MiniMax M2.1MiniMax37.08%
39GPT-5OpenAI37.08%
40Kimi K2 ThinkingMoonshot AI37.08%
41DeepSeek V3p2 ThinkingFireworks AI35.95%
42DeepSeek V3p2Fireworks AI34.83%
43Laguna M.1Poolside31.46%
44Gemini 2.5 ProGoogle30.34%
45Mistral Medium 3.5Mistral AI30.34%
46Grok 4 Fast ReasoningxAI29.21%
47Laguna Xs.2Poolside28.09%
48GLM 4.6Zhipu AI28.09%
49Grok 4 0709xAI28.09%
50GPT-5 MiniOpenAI26.97%
51Moonshotai Kimi K2 InstructTogether AI25.84%
52Grok 4.1 Fast ReasoningxAI24.72%
53Gemini 3.1 Flash Lite PreviewGoogle24.72%
54Qwen3.5 FlashAlibaba24.72%
55Qwen3 MaxAlibaba24.72%
56DeepSeek V3p1Fireworks AI22.47%
57Gemini 2.5 Flash Preview 09 2025 ThinkingGoogle21.35%
58Qwen3 MaxAlibaba20.23%
59GPT Oss 120bFireworks AI19.10%
60Grok 4.1 Fast Non ReasoningxAI17.98%
61Trinity Large ThinkingArcee-Ai17.98%
62Mistral Small 2603Mistral AI16.85%
63GPT-4.1OpenAI14.61%
64Magistral Medium 2509Mistral AI13.48%
65Mistral Large 2512Mistral AI8.99%
66Command A 03 2025Cohere2.25%
67Llama4 Maverick Instruct BasicFireworks AI2.25%