context.vn

hle

45 models evaluated

#ModelProviderTypeScore
1Claude Opus 5AnthropicClosedclaude-opus-5
2Claude Mythos 5AnthropicClosedclaude-mythos-5
3Muse Spark 1.1MetaClosedmuse-spark-1-1
4GPT-5.4 ProOpenAI · Closed58.7%
5Claude Opus 4.8Anthropic · Closed57.9%
6Claude Sonnet 5Anthropic · Closed57.4%
7GPT-5.5 ProOpenAI · Closed57.2%
8Kimi K3Moonshot AI · Closed56%
9GLM-5.2Z.AI · Open weight54.7%
10Claude Opus 4.7 (Adaptive)Anthropic · Closed54.7%
11Claude Opus 4.6Anthropic · Closed53%
12GLM-5.1Z.AI · Open weight52.3%
13GPT-5.5OpenAI · Closed52.2%
14GPT-5.4OpenAI · Closed52.1%
15GLM-5Z.AI · Open weight50.4%
16Muse SparkMeta · Closed50.4%
17Claude Sonnet 4.6Anthropic · Closed49%
18MiMo-V2.5-ProXiaomi · Closed48%
19Agents-A1InternScience · Open weight47.6%
20InklingThinking Machines Lab · Open weight46%
21GPT-5.4 miniOpenAI · Closed41.5%
22Qwen3.7 MaxAlibaba · Closed41.4%
23Gemini 3.5 FlashGoogle · Closed40.2%
24DeepSeek V4 Pro (Max)DeepSeek · Open weight37.7%
25GPT-5.4 nanoOpenAI · Closed37.7%
26Grok 4.3xAI · Closed35%
27DeepSeek V4 Flash (Max)DeepSeek · Open weight34.8%
28Qwen3.7 PlusAlibaba · Closed34.7%
29Kimi K2.6Moonshot AI · Open weight34.7%
30DeepSeek V4 Pro (High)DeepSeek · Open weight34.5%
31Claude Opus 4.5Anthropic · Closed30.8%
32Kimi K2.5Moonshot AI · Open weight30.1%
33DeepSeek V4 Flash (High)DeepSeek · Open weight29.4%
34Qwen3.6 PlusAlibaba · Closed28.8%
35Qwen3.5 397BAlibaba · Open weight28.7%
36Nemotron 3 UltraNVIDIA · Open weight26.7%
37Gemma 4 31BGoogle · Open weight26.5%
38Hy3 PreviewTencent · Open weight25.5%
39GLM-4.7Z.AI · Open weight24.8%
40Qwen3.6-27BAlibaba · Open weight24%
41Qwen3.6-35B-A3BAlibaba · Open weight21.4%
42Gemini 2.5 ProGoogle · Closed18.8%
43Gemma 4 26B A4BGoogle · Open weight17.2%
44DeepSeek V4 FlashDeepSeek · Open weight8.1%
45DeepSeek V4 ProDeepSeek · Open weight7.7%