context.vn

charxiv

29 models evaluated

#ModelProviderTypeScore
1Claude Mythos 5AnthropicClosedclaude-mythos-5
2Kimi K3Moonshot AIClosedkimi-3
3Claude Opus 4.7 (Adaptive)AnthropicClosedclaude-opus-4-7-max
4Claude Opus 4.8Anthropic · Closed89.9%
5Muse Spark 1.1Meta · Closed88.4%
6Claude Sonnet 5Anthropic · Closed88.3%
7Sakana Fugu-UltraSakana AI · Closed86.6%
8Muse SparkMeta · Closed86.4%
9Qwen3.7 PlusAlibaba · Closed85.9%
10Sakana FuguSakana AI · Closed85.1%
11Gemini 3.5 FlashGoogle · Closed84.2%
12GPT-5.4OpenAI · Closed82.8%
13GPT-5.2OpenAI · Closed82.1%
14InklingThinking Machines Lab · Open weight82%
15Qwen3.6 PlusAlibaba · Closed81.5%
16Gemini 3 ProGoogle · Closed81.4%
17MiMo-V2.5Xiaomi · Closed81%
18Qwen3.5 397BAlibaba · Open weight80.8%
19Kimi K2.6Moonshot AI · Open weight80.4%
20Gemini 3.1 ProGoogle · Closed80.2%
21Qwen3.6-27BAlibaba · Open weight78.4%
22Qwen3.6-35B-A3BAlibaba · Open weight78%
23Claude Sonnet 4.6Anthropic · Closed77.4%
24Qwen3.5-122B-A10BAlibaba · Open weight77.2%
25Nemotron 3 Nano Omni 30B A3BNVIDIA · Open weight76.3%
26Gemini 3.1 Flash-LiteGoogle · Closed73.2%
27Claude Opus 4.5Anthropic · Closed68.5%
28Grok 4.20xAI · Closed60.9%
29Command A+Cohere · Open weight52.7%