context.vn

terminal Bench2

45 models evaluated

#ModelProviderTypeScore
1GPT-5.6 SolOpenAIClosedgpt-5-6-sol
2Claude Mythos 5AnthropicClosedclaude-mythos-5
3GPT-5.6 TerraOpenAIClosedgpt-5-6-terra
4GPT-5.6 LunaOpenAI · Closed84.7%
5Claude Fable 5Anthropic · Closed84.3%
6Grok 4.5xAI · Closed83.3%
7Sakana Fugu-UltraSakana AI · Closed82.1%
8GPT-5.5OpenAI · Closed82.0%
9SWE-1.7Cognition · Closed81.5%
10GLM-5.2Z.AI · Open weight81.0%
11Claude Sonnet 5Anthropic · Closed80.4%
12Sakana FuguSakana AI · Closed80.2%
13Muse Spark 1.1Meta · Closed80.0%
14Ornith-1.0-397BDeepReinforce AI · Open weight77.5%
15Gemini 3.5 FlashGoogle · Closed76.2%
16Claude Opus 4.8Anthropic · Closed74.6%
17Qwen3.7 PlusAlibaba · Closed70.3%
18Laguna S 2.1Poolside · Open weight70.2%
19Qwen3.7 MaxAlibaba · Closed69.7%
20Claude Opus 4.7 (Adaptive)Anthropic · Closed69.4%
21Composer 2.5Cursor · Closed69.3%
22MiMo-V2.5-ProXiaomi · Closed68.4%
23DeepSeek V4 Pro (Max)DeepSeek · Open weight67.9%
24Kimi K2.6Moonshot AI · Open weight66.7%
25MiniMax M3MiniMax · Open weight66.0%
26MiMo-V2.5Xiaomi · Closed65.8%
27Qwen 3.6 Max (preview)Alibaba · Closed65.4%
28Ornith-1.0-35BDeepReinforce AI · Open weight64.2%
29InklingThinking Machines Lab · Open weight63.8%
30DeepSeek V4 Pro (High)DeepSeek · Open weight63.3%
31Composer 2Cursor · Closed61.7%
32Step 3.7 FlashStepFun · Open weight59.5%
33Qwen3.6-27BAlibaba · Open weight59.3%
34DeepSeek V4 ProDeepSeek · Open weight59.1%
35DeepSeek V4 Flash (Max)DeepSeek · Open weight56.9%
36DeepSeek V4 Flash (High)DeepSeek · Open weight56.6%
37Nemotron 3 UltraNVIDIA · Open weight56.4%
38Hy3 PreviewTencent · Open weight54.4%
39Gemini 3.5 Flash-LiteGoogle · Closed54.0%
40Qwen3.6-35B-A3BAlibaba · Open weight51.5%
41DeepSeek V4 FlashDeepSeek · Open weight49.1%
42MAI-Thinking-1Microsoft · Closed46.0%
43Laguna M.1Poolside · Closed45.8%
44Ornith-1.0-9BDeepReinforce AI · Open weight43.1%
45Laguna XS.2Poolside · Open weight35.7%