context.vn

vals Swe Bench

75 models evaluated

#ModelProviderTypeScore
1Anthropicanthropic/claude-opus-5Claude Opus 597.00%
2OpenAIopenai/gpt-5.6-solGPT-5.6 Sol96.20%
3Anthropicanthropic/claude-fable-5Claude Fable 595.00%
4Kimi K3Moonshot AI93.40%
5GPT-5.6 LunaOpenAI93.00%
6Claude Opus 4.8Anthropic88.60%
7Grok 4.5xAI86.60%
8Claude Opus 4.8 Claude CodeAnthropicClaude Code85.80%
9GLM 5.2Zhipu AI82.80%
10GPT-5.5OpenAI82.60%
11Muse Spark 1.1Meta82.00%
12Claude Opus 4.7Anthropic82.00%
13Composer 2.5CursorCursor CLI79.60%
14Gemini 3.6 FlashGoogle79.60%
15Claude Sonnet 5Anthropic79.60%
16Gemini 3.5 FlashGoogle78.80%
17Gemini 3.1 Pro PreviewGoogle78.80%
18GPT-5.4OpenAI78.20%
19Claude Opus 4.6 ThinkingAnthropic78.20%
20Kimi K2.7 CodeMoonshot AI78.20%
21GPT-5.3 CodexOpenAI78.00%
22InklingThinkingmachines77.60%
23Claude Sonnet 4.6Anthropic77.40%
24DeepSeek V4 ProDeepSeek77.40%
25GPT-5.5 CodexOpenAICodex76.40%
26Claude Opus 4.5 20251101 ThinkingAnthropic76.40%
27Gemini 3 Pro PreviewGoogle76.40%
28GLM 5.1Zhipu AI76.40%
29GPT-5.5 FactoryOpenAIFactory76.20%
30Kimi K2.6Moonshot AI76.20%
31GPT-5.2OpenAI75.80%
32GPT-5.6 TerraOpenAI75.20%
33Gemini 3 Flash PreviewGoogle75.00%
34Gemini 3.5 Flash LiteGoogle75.00%
35MiniMax M3MiniMax75.00%
36MiniMax M2.1MiniMax74.80%
37Muse SparkMeta74.40%
38MiniMax M2.5MiniMax74.20%
39Mimo V2.5 ProXiaomi74.00%
40MiniMax M2.7MiniMax73.80%
41Qwen3.6 PlusAlibaba73.40%
42GPT-5.4 MiniOpenAI73.00%
43Qwen3.6 Max PreviewAlibaba72.80%
44GPT-5.2 CodexOpenAI72.40%
45Grok 4.20 0309 ReasoningxAI72.20%
46Grok 4.3xAI71.40%
47GLM 5 ThinkingZhipu AI71.40%
48Qwen3.5 Plus ThinkingAlibaba71.20%
49Mimo V2.5Xiaomi71.00%
50Kimi K2.5 ThinkingMoonshot AI70.00%
51Claude Sonnet 4.5 20250929 ThinkingAnthropic70.00%
52Qwen3.6 27bAlibaba70.00%
53GPT-5.4 NanoOpenAI69.80%
54GPT-5.1OpenAI69.80%
55GLM 4.7Zhipu AI69.40%
56GPT-5OpenAI69.00%
57Nemotron 3 Ultra 550b A55bNvidia69.00%
58Qwen3.7 MaxAlibaba68.80%
59DeepSeek V3p2 ThinkingFireworks AI67.60%
60Claude Haiku 4.5 20251001 ThinkingAnthropic66.60%
61Mistral Medium 3.5Mistral AI66.40%
62Qwen3.5 FlashAlibaba64.40%
63Gemini 3.1 Flash Lite PreviewGoogle62.80%
64Devstral 2512Mistral AI62.80%
65GPT-5 MiniOpenAI60.80%
66Kimi K2 ThinkingMoonshot AI60.20%
67Grok 4 0709xAI57.80%
68Laguna M.1Poolside57.60%
69Laguna Xs.2Poolside55.20%
70Gemini 2.5 ProGoogle54.40%
71Grok 4 Fast ReasoningxAI45.40%
72Grok 4.1 Fast ReasoningxAI41.40%
73Mistral Large 2512Mistral AI41.40%
74GPT Oss 120bFireworks AI33.60%
75Command A 03 2025Cohere7.80%