context.vn

swe Atlas Refactoring

12 models evaluated

#ModelProviderTypeScore
1Anthropic54.8%Fable-5 (Claude Code) xHighOverall
4GPT-5.5OpenAI · Closed44.8%
5GPT-5.4OpenAI · Closed44.3%
6GLM-5.2Z.AI · Open weight42.4%
7GPT-5.3 CodexOpenAI · Closed42.4%
8Claude Opus 4.6Anthropic · Closed35.6%
9Gemini 3.1 ProGoogle · Closed33.8%
10Claude Sonnet 4.6Anthropic · Closed32.2%
11GLM-5Z.AI · Open weight24.2%
12Kimi K2.5Moonshot AI · Open weight20.9%
13MiniMax M2.5MiniMax · Closed19.5%
14Gemini 3 FlashGoogle · Closed10.0%