context.vn

bullshit Bench V2

77 models evaluated

#ModelProviderTypeScore
4Claude Opus 4.5 (high)Anthropic · Closed90%
6Claude Opus 4.6 (high)Anthropic · Closed87%
8Claude Opus 4.7 (none)Anthropic · Closed83%
9Claude Sonnet 5 (low)Anthropic · Closed80%
10Claude Sonnet 4.5 (high)Anthropic · Closed79%
13Qwen3.5 397B (Reasoning) (high)Alibaba · Open weight78%
14Claude Haiku 4.5 (high)Anthropic · Closed77%
17Kimi K3 (xhigh)Moonshot AI · Closed73%
18Qwen3.6 Plus (none)Alibaba · Closed72%
21Qwen3.7 Max (none)Alibaba · Closed71%
22Qwen3.5 397B (none)Alibaba · Open weight69%
23Grok 4.20 Multi-Agent Beta (low)67%
24Kimi K2.6 (none)Moonshot AI · Open weight65%
27MiniMax M3 (xhigh)MiniMax · Open weight63%
29MiMo-V2.5-Pro (xhigh)Xiaomi · Closed62%
33Claude Fable 5 (xhigh)Anthropic · Closed54%
34Grok 4.5 (low)xAI · Closed54%
37Nemotron 3 Super 120B A12B (xhigh)NVIDIA · Open weight54%
38GPT-5.6 Terra (max)OpenAI · Closed53%
39Kimi K2.5 (none)Moonshot AI · Open weight52%
40Grok 4.3 (minimal)xAI · Closed50%
45GPT-5.4 (none)OpenAI · Closed48%
46Gemini 3 Pro (low)Google · Closed48%
47GPT-5.6 Sol (low)OpenAI · Closed47%
48GPT-5.5 (xhigh)OpenAI · Closed47%
56GPT-5.2-Codex (low)OpenAI · Closed45%
57Claude 3.5 SonnetAnthropic · Closed45%
58GPT-5.1OpenAI · Closed45%
60Claude 4.1 Opus (none)Anthropic · Closed43%
66GPT-5.6 Luna (max)OpenAI · Closed40%
67GPT-5.3 InstantOpenAI · Closed40%
71GPT-5.2 (none)OpenAI · Closed38%
73Gemini 3.1 Pro (low)Google · Closed37%
76GPT-5.5 Pro (xhigh)OpenAI · Closed36%
78Gemini 3 Pro Deep Think (high)Google · Closed36%
79MiMo-V2.5 (xhigh)Xiaomi · Closed35%
84GPT-5.4 mini (high)OpenAI · Closed32%
86GPT-5.1-Codex-MaxOpenAI · Closed32%
88Kimi K2.5 (Reasoning) (high)Moonshot AI · Closed31%
90GLM-5-Turbo (high)Z.AI · Closed31%
92GLM-5.2 (xhigh)Z.AI · Open weight31%
93Claude 4 Sonnet (high)Anthropic · Closed30%
96Llama 4 MaverickMeta · Open weight28%
97GLM-5 (Reasoning) (high)Z.AI · Open weight28%
99GPT-5.2 InstantOpenAI · Closed27%
100o3OpenAI · Closed26%
103Gemma 4 31B (high)Google · Open weight25%
104GPT-5.3 Codex (low)OpenAI · Closed24%
107GLM-5.1 (xhigh)Z.AI · Open weight22%
108Step 3.5 Flash (xhigh)StepFun · Open weight22%
110Gemma 4 26B A4B (xhigh)Google · Open weight21%
113Gemini 2.5 ProGoogle · Closed20%
114GLM-5 (none)Z.AI · Open weight20%
116Gemini 3.5 Flash (xhigh)Google · Closed20%
118Grok 4.1 Fast (high)xAI · Closed19%
119Llama 4 ScoutMeta · Open weight19%
120Gemini 2.5 FlashGoogle · Closed19%
123DeepSeek V4 Flash (none)DeepSeek · Open weight18%
126Trinity-Large-Thinking (minimal)Arcee AI · Open weight17%
127MiMo-V2-Flash (none)Xiaomi · Open weight16%
128Hy3 (none)Tencent · Open weight16%
130DeepSeek V4 Pro (xhigh)DeepSeek · Open weight14%
132GPT-5.4 nano (high)OpenAI · Closed14%
134GPT-4.1OpenAI · Closed14%
137DeepSeek V3.2 (Thinking) (high)DeepSeek · Open weight13%
143Gemini 3.1 Flash-LiteGoogle · Closed11%
144Seed 1.6 (none)ByteDance · Closed11%
145GPT-OSS 120B (low)OpenAI · Open weight11%
148Gemini 3 Flash (high)Google · Closed10%
149DeepSeek V3.2 (none)DeepSeek · Open weight10%
150Claude 3 HaikuAnthropic · Closed10%
153Kimi K2Moonshot AI · Closed10%
155MiniMax M2.5 (low)MiniMax · Closed9%
158GLM-4.5 (xhigh)Z.AI · Closed8%
159MiniMax M2.7 (high)MiniMax · Open weight8%
160DeepSeek-R1 (xhigh)DeepSeek · Open weight8%
161o4-mini (high) (low)OpenAI · Closed8%