context.vn

inference Bench

16 models evaluated

#ModelProviderTypeScore
1Claude Opus 4.8 (xHigh)AnthropicClosed7.34x
2GPT-5.4 (High)OpenAIClosed6.16x
3Claude Sonnet 4.6AnthropicClosed5.56x
4GPT-5.3 Codex (High)OpenAI · Closed5.49x
5GPT-5.5 (xHigh)OpenAI · Closed5.45x
6Gemini 3.1 ProGoogle · Closed4.92x
7Kimi K2.6Moonshot AI · Open weight4.51x
8Claude Opus 4.6Anthropic · Closed4.38x
9GPT-5.2OpenAI · Closed4.28x
11Gemini 3.5 FlashGoogle · Closed4.16x
12Claude Opus 4.5Anthropic · Closed3.76x
13GPT-5.1 Codex MaxOpenAI · Closed3.59x
14GLM-5Z.AI · Open weight3.22x
15Claude Sonnet 4.5Anthropic · Closed3.18x
16Claude Haiku 4.5Anthropic · Closed2.78x
18GPT-5.2 CodexOpenAI · Closed1.98x