context.vn
Menu

vals Swe Bench

87 models evaluated

#ModelProviderTypeScore
1Claude Opus 5AnthropicProprietary97.0%
2DeepSeek V4 Pro 0813DeepSeekProprietarymax reasoning
3GPT-5.6 SolOpenAIProprietarymax reasoning
4Grok 4.6xAI · Closedhigh reasoning95.6%
5GPT-5.6 TerraOpenAI · Closedmax reasoning95.4%
6GLM-5.3Z.AI · Open weightmax reasoning95.4%
7Claude Fable 5Anthropic · Closed95.0%
8Kimi K3Moonshot AI · Closed93.4%
9GPT-5.6 LunaOpenAI · Closedmax reasoning93.0%
10GLM-5.3-FlashZ.AI · Open weightmax reasoning92.0%
11DeepSeek V4 Flash 0731DeepSeek · Closedhigh reasoning88.8%
12Claude Opus 4.8Anthropic · Closed88.6%
13Grok 4.5xAI · Closedhigh reasoning86.6%
14Muse Spark 1.2Meta · Closedxhigh reasoning86.6%
15Qwen3.8-27BAlibaba · Open weightxhigh reasoning86.0%
16Claude Opus 4.8 Claude CodeAnthropicClaude CodeClaude Code
17Qwen3.8 MaxAlibaba · Open weight85.6%
18GLM-5.2Z.AI · Open weightmax reasoning82.8%
19GPT-5.5OpenAI · Closedxhigh reasoning82.6%
20Inkling-SmallThinking Machines Lab · Open weight0.99 reasoning82.2%
21Muse Spark 1.1Meta · Closedxhigh reasoning82.0%
22Claude Opus 4.7Anthropic · Closed82.0%
23Gemini 3.7 FlashGoogle · Closedhigh reasoning80.8%
24Gemini 3.8 FlashGoogle · Closedhigh reasoning80.0%
25Composer 2.5Cursor · ClosedCursor CLICursor CLI
26Gemini 3.6 FlashGoogle · Closedhigh reasoning79.6%
27Claude Sonnet 5Anthropic · Closed79.6%
28Gemini 3.5 FlashGoogle · Closedhigh reasoning78.8%
29Gemini 3.1 Pro PreviewGooglehigh reasoning78.8%
30GPT-5.4OpenAI · Closedxhigh reasoning78.2%
31Claude Opus 4.6 (Adaptive)Anthropic · Closed78.2%
32Kimi K2.7 CodeMoonshot AI · Open weight78.2%
33GPT-5.3 CodexOpenAI · Closedxhigh reasoning78.0%
34InklingThinking Machines Lab · Open weight0.99 reasoning77.6%
35Claude Sonnet 4.6Anthropic · Closed77.4%
37GPT-5.5 CodexOpenAICodexCodex
38Claude Opus 4.5 ThinkingAnthropic · Closed76.4%
39Gemini 3 Pro PreviewGooglehigh reasoning76.4%
40GLM-5.1Z.AI · Open weight76.4%
41GPT-5.5 FactoryOpenAIFactoryFactory
42Kimi K2.6Moonshot AI · Open weight76.2%
43GPT-5.2OpenAI · Closedxhigh reasoning75.8%
44Gemini 3 Flash PreviewGooglehigh reasoning75.0%
45Gemini 3.5 Flash-LiteGoogle · Closedhigh reasoning75.0%
46MiniMax M3MiniMax · Open weight75.0%
47MiniMax M2.1MiniMax74.8%
48Muse SparkMeta · Closed74.4%
49MiniMax M2.5MiniMax · Closed74.2%
50MiMo-V2.5-ProXiaomi · Closed74.0%
51MiniMax M2.7MiniMax · Open weight73.8%
52Qwen3.6 PlusAlibaba · Closed73.4%
53GPT-5.4 miniOpenAI · Closedxhigh reasoning73.0%
54Qwen 3.6 Max (preview)Alibaba · Closed72.8%
55GPT-5.2-CodexOpenAI · Closedhigh reasoning72.4%
56Grok 4.20 0309 ReasoningxAI72.2%
57Grok 4.3xAI · Closedhigh reasoning71.4%
58GLM 5 ThinkingZhipu AI71.4%
59Qwen3.5 Plus ThinkingAlibaba71.2%
60MiMo-V2.5Xiaomi · Closed71.0%
61Kimi K2.5 ThinkingMoonshot AI70.0%
62Claude Sonnet 4.5 ThinkingAnthropic · Closed70.0%
63Qwen3.6-27BAlibaba · Open weight70.0%
64GPT-5.4 nanoOpenAI · Closedhigh reasoning69.8%
65GPT-5.1OpenAI · Closedhigh reasoning69.8%
66GLM-4.7Z.AI · Open weight69.4%
67GPT-5OpenAIhigh reasoning69.0%
68Nemotron 3 Ultra 550b A55bNvidia69.0%
69Qwen3.7 MaxAlibaba · Closed68.8%
70DeepSeek V3p2 ThinkingFireworks AIhigh reasoning67.6%
71Claude Haiku 4.5 ThinkingAnthropic · Closed66.6%
72Mistral Medium 3.5Mistral AIhigh reasoning66.4%
73Ling 3.0 Flash 2607Ant65.2%
74Qwen3.5 FlashAlibaba · Closed64.4%
75Gemini 3.1 Flash Lite PreviewGooglehigh reasoning62.8%
76Devstral 2512Mistral AI62.8%
77GPT-5 miniOpenAI · Closedhigh reasoning60.8%
78Kimi K2 ThinkingMoonshot AI60.2%
79Grok 4 0709xAI57.8%
80Laguna M.1Poolside · Closed57.6%
81Laguna XS.2Poolside · Open weight55.2%
82Gemini 2.5 ProGoogle · Closed54.4%
83Nemotron Lightning 3p5 30b A3bFireworks AI52.8%
84Grok 4 Fast (Reasoning)xAI · Closed45.4%
85Grok 4.1 Fast (Reasoning)xAI · Closed41.4%
86Mistral Large 2512Mistral AI41.4%
87GPT-OSS 120BOpenAI · Open weight33.6%
88Command A 03 2025Cohere7.8%