context.vn

deep Swe

11 models evaluated

#ModelProviderTypeScore
1OpenAImini_swe_agent_gpt_5_6_sol_maxgpt-5-6-sol[max]72.7%
4kimi-k3[max]Moonshot AI · Closed68.5%
6gpt-5-5[xhigh]OpenAI · Closed67.0%
7claude-opus-4-8[max]Anthropic · Closed59.0%
8claude-sonnet-5[max]Anthropic · Closed53.8%
11gpt-5-4[xhigh]OpenAI · Closed51.8%
12glm-5-2[max]Z.AI · Open weight43.8%
13gemini-3-5-flash[medium]Google · Closed37.4%
14kimi-k2-7-codeMoonshot AI · Open weight30.5%
15claude-sonnet-4-6[high]Anthropic · Closed29.9%
16gemini-3-1-pro-preview[high]Google · Closed11.8%