context.vn

toolathlon

26 models evaluated

#ModelProviderTypeScore
1Muse Spark 1.1MetaClosedmuse-spark-1-1
2Claude Opus 4.8AnthropicClosedclaude-opus-4-8
3GPT-5.6 SolOpenAIClosedgpt-5-6-sol
4Gemini 3.5 FlashGoogle · Closed56.5%
5GPT-5.5OpenAI · Closed55.6%
6GPT-5.4OpenAI · Closed54.6%
7GPT-5.6 LunaOpenAI · Closed53.4%
8GPT-5.6 TerraOpenAI · Closed53.1%
9DeepSeek V4 Pro (Max)DeepSeek · Open weight51.8%
10Kimi K2.6Moonshot AI · Open weight50%
11Step 3.7 FlashStepFun · Open weight49.5%
12DeepSeek V4 Pro (High)DeepSeek · Open weight49%
13GLM-5.2Z.AI · Open weight48.2%
14DeepSeek V4 Flash (Max)DeepSeek · Open weight47.8%
15DeepSeek V4 ProDeepSeek · Open weight46.3%
16MiniMax M2.7MiniMax · Open weight46.3%
17Claude Opus 4.5Anthropic · Closed43.5%
18DeepSeek V4 Flash (High)DeepSeek · Open weight43.5%
19GPT-5.4 miniOpenAI · Closed42.9%
20DeepSeek V4 FlashDeepSeek · Open weight40.7%
21Qwen3.6 PlusAlibaba · Closed39.8%
22GLM-5Z.AI · Open weight38%
23Qwen3.5 397BAlibaba · Open weight36.3%
24GPT-5.4 nanoOpenAI · Closed35.5%
25Kimi K2.5Moonshot AI · Open weight27.8%
26Qwen3.6-35B-A3BAlibaba · Open weight26.9%