context.vn
Menu

BenchLM Benchmarks

219 benchmarks · 818 model scores · Data from Sep 23, 2026

Reasoning23 benchmarks

musr

0 models

bbh

3 models

3Soofi S 30B-A3BSoofi Project78.8%
4MiniCPM5-1BOpenBMB · Open weight
5Gemma 4 12BGoogle · Open weight
drop

2 models

3Celeris-1Celeris81.4%
4Soofi S 30B-A3BSoofi Project · Open weight
hellaswag

0 models

winogrande

0 models

cluewsc

0 models

lisan Bench

135 models

1Claude Opus 4.7 (Adaptive)Anthropic5122.60
2Claude Opus 5Anthropic5068.25
3Claude Fable 5Anthropic4561.82
4Claude Opus 4.6 (Adaptive)Anthropic · Closed
5Kimi K3Moonshot AI · Closed
+130 more
pp Bench

62 models

1Claude Fable 5Anthropic97.6%
2GPT-5.5OpenAI83.3%
3GPT-5.4OpenAI70.2%
4GPT-5.2OpenAI · Closed
5Claude Opus 4.7Anthropic · Closed
+57 more
long Bench V2

14 models

1Qwen3.8 MaxAlibaba66.3%
2Claude Opus 4.5Anthropic64.4%
3Qwen3.5 397BAlibaba63.2%
4Qwen3.6 PlusAlibaba · Closed
5Nemotron 3 UltraNVIDIA · Open weight
+9 more
mrcrv2

9 models

1Sakana Fugu-UltraSakana AI93.6%
2Qwen3.8 MaxAlibaba92.9%
3Qwen3.7 PlusAlibaba91.7%
4Qwen3.7 MaxAlibaba · Closed
5Sakana FuguSakana AI · Closed
+4 more
mrcrv2 64 128

2 models

1Gemini 3.7 FlashGoogle97%
2GPT-5.5OpenAI83.1%
mrcrv2 128 256

2 models

1GPT-5.5OpenAI87.5%
2Claude Opus 4.7 (Adaptive)Anthropic59.2%
graphwalks Bfs128k

1 models

1MAI-Thinking-1Microsoft90%
mrcr1m

4 models

1DeepSeek V4 Pro 0813DeepSeek83.5%
3DeepSeek V4 Flash 0731DeepSeek78.7%
5Muse Spark 1.1Meta · Closed
8Gemini 3.5 FlashGoogle · Closed
corpus Qa1m

2 models

1DeepSeek V4 Pro 0813DeepSeek62.0%
2DeepSeek V4 Flash 0731DeepSeek60.5%
arc Agi2

23 models

1GPT-6 AstraOpenAI95%
2GPT-5.6 SolOpenAI92.5%
3Claude Opus 5Anthropic90.4%
4Claude Fable 5.1Anthropic · Closed
5GPT-5.5OpenAI · Closed
+18 more
ai Needle

4 models

1Claude Opus 4.5Anthropic74%
2Qwen3.5 397BAlibaba68.7%
3Qwen3.6 PlusAlibaba68.3%
4GLM-5Z.AI · Open weight
gpqa Diamond

66 models

1GPT-6 AstraOpenAI96.0%
2Sakana Fugu-UltraSakana AI95.5%
3Sakana FuguSakana AI95.5%
4GPT-5.6 SolOpenAI · Closed
5Gemini 3.1 ProGoogle · Closed
+61 more
lcr

195 models

1Kimi K3Moonshot AI88.7%
2Step 5 PreviewStepFun88.3%
3MiMo-V2.6-ProXiaomi86.3%
4Claude Fable 5.1Anthropic · Closed
5Claude Opus 5.5Anthropic · Closed
+190 more
critpt

198 models

1GPT-5.6 SolOpenAI32.3%
2GPT-6 AstraOpenAI31.7%
3Claude Opus 5.5Anthropic31.7%
4GPT-6 SolOpenAI · Closed
5GPT-5.5 ProOpenAI · Closed
+193 more
bullshit Bench V2

96 models

1Claude Opus 4.8Anthropic95%
2Qwen3.8 MaxAlibaba95%
4Claude Sonnet 4.6Anthropic · Closed
5Claude Opus 4.5Anthropic · Closed
7Claude Opus 4.6Anthropic · Closed
+91 more
wild Bench

0 models