context.vn
Menu

deep Swe

25 models evaluated

#ModelProviderTypeScore
4GPT-5.6 SolOpenAI · Closedmini-swe-agent · max reasoning72.7%
5Claude Fable 5Anthropic · Closedmini-swe-agent · max reasoning69.7%
6GPT-5.6 TerraOpenAI · Closedmini-swe-agent · max reasoning69.6%
7GLM-5.3Z.AI · Open weightmini-swe-agent · max reasoning69.0%
8Kimi K3Moonshot AI · Closedmini-swe-agent · max reasoning68.5%
9GPT-5.6 LunaOpenAI · Closedmini-swe-agent · max reasoning67.2%
10GPT-5.5OpenAI · Closedmini-swe-agent · xhigh reasoning67.0%
11Grok 4.6xAI · Closedmini-swe-agent · xhigh reasoning66.7%
12Gemini 3.7 FlashGoogle · Closedmini-swe-agent · high reasoning65.3%
13GLM-5.3-FlashZ.AI · Open weightmini-swe-agent · max reasoning63.4%
14DeepSeek V4 Pro 0813DeepSeek · Closedmini-swe-agent · max reasoning62.8%
15Claude Opus 4.8Anthropic · Closedmini-swe-agent · max reasoning59.0%
16Qwen3.8 MaxAlibaba · Open weightmini-swe-agent · xhigh reasoning57.5%
17Muse Spark 1.2Meta · Closedmini-swe-agent · xhigh reasoning54.9%
18Claude Sonnet 5Anthropic · Closedmini-swe-agent · max reasoning53.8%
19Grok 4.5xAI · Closedmini-swe-agent · high reasoning53.8%
20DeepSeek V4 Flash 0731DeepSeek · Closedmini-swe-agent · max reasoning53.3%
21Muse Spark 1.1Meta · Closedmini-swe-agent · xhigh reasoning53.3%
22GPT-5.4OpenAI · Closedmini-swe-agent · xhigh reasoning51.8%
23Gemini 3.6 FlashGoogle · Closedmini-swe-agent · high reasoning46.7%
24GLM-5.2Z.AI · Open weightmini-swe-agent · max reasoning43.8%
25Gemini 3.5 FlashGoogle · Closedmini-swe-agent · high reasoning36.1%
26Kimi K2.7 CodeMoonshot AI · Open weightmini-swe-agent30.5%
27Claude Sonnet 4.6Anthropic · Closedmini-swe-agent · high reasoning29.9%
28Gemini 3.1 ProGoogle · Closedmini-swe-agent · high reasoning11.7%