context.vn
Menu

BenchLM Benchmarks

219 benchmarks · 6355 model scores · Data from Sep 23, 2026

Coding25 benchmarks

humaneval

2 models

1BTL-3Bad Theory Labs95.1%
3Soofi S 30B-A3BSoofi Project73.8%
big Code Bench

1 models

2Ternary Bonsai 2 27BPrism ML58.1%
codeforces

4 models

1DeepSeek V4.1 FlashDeepSeek3471.0
2DeepSeek V4 Pro 0813DeepSeek3206.0
3dots3-note PreviewDots Studio3056.0
4DeepSeek V4 Flash 0731DeepSeek · Closed
swe Verified

75 models

1Claude Opus 5Anthropic96%
2Claude Mythos 5Anthropic95.5%
3Claude Fable 5Anthropic95%
4Claude Opus 4.8Anthropic · Closed
5Claude Opus 4.7 (Adaptive)Anthropic · Closed
+70 more
swe Rebench

13 models

1Claude Opus 4.6Anthropic65.3%
2GLM-5Z.AI62.8%
3GLM-5.1Z.AI62.7%
4DeepSeek V3.2DeepSeek · Open weight
5Claude Sonnet 4.6Anthropic · Closed
+8 more
live Code Bench

8 models

1Qwen3.7 MaxAlibaba91.6%
2Qwen3.7 PlusAlibaba89.6%
3Solar Pro 4Upstage87.8%
4GLM-4.7Z.AI · Open weight
5Qwen3.6-27BAlibaba · Open weight
+3 more
live Code Bench V6

31 models

1Sakana Fugu-UltraSakana AI93.2%
2Sakana FuguSakana AI92.9%
3Qwen3.8-Omni-FlashAlibaba92.6%
4Solar Open 2Upstage · Open weight
5Qwen3.8-Flash-NextAlibaba · Open weight
+26 more
live Code Bench Pro

8 models

1Sakana Fugu-UltraSakana AI90.8%
2Sakana FuguSakana AI87.8%
3GPT-5.4OpenAI87.5%
4Gemini 3.1 ProGoogle · Closed
5Muse SparkMeta · Closed
+3 more
flteval

0 models

swe Pro

70 models

1Claude Opus 5.5Anthropic89.9%
2Claude Fable 5.1Anthropic81.2%
3Claude Mythos 5Anthropic80.3%
4Claude Fable 5Anthropic · Closed
5Claude Opus 5Anthropic · Closed
+65 more
swe Multilingual

42 models

1Claude Opus 5.5Anthropic93.9%
2Claude Opus 5Anthropic89.5%
3Claude Fable 5.1Anthropic89.1%
4Claude Opus 4.8Anthropic · Closed
5Hy4 previewTencent · Open weight
+37 more
swe Multimodal

5 models

1Claude Opus 5.5Anthropic61.4%
2Claude Opus 5Anthropic59.4%
3Claude Fable 5.1Anthropic54.7%
4Claude Opus 4.8Anthropic · Closed
5Claude Sonnet 5Anthropic · Closed
cursor Bench31

6 models

1Claude Opus 5.5Anthropic57.8%
2Claude Fable 5.1Anthropic51.8%
3Grok 4.7xAI46.3%
4GPT-5.6 SolOpenAI · Closed
5Gemini 3.8 FlashGoogle · Closed
+1 more
multi Swe Bench

1 models

1MiniMax M2.7MiniMax52.7%
vibe Pro

1 models

1MiniMax M2.7MiniMax55.6%
vibe Code Bench

96 models

1Claude Fable 5AnthropicOpenHands
2Claude Opus 5.5AnthropicOpenHands
3Claude Fable 5.1AnthropicOpenHands
4GPT-6 AstraOpenAI · ClosedOpenHands
5Claude Opus 5Anthropic · ClosedOpenHands
+91 more
program Bench

17 models

1Claude Opus 5Anthropic37.0%
2Claude Opus 4.8Anthropic16.5%
3GPT-5.6 SolOpenAI15.5%
4GPT-5.5OpenAI · Closed
5GLM-5.2Z.AI · Open weight
+12 more
nl2 Repo

29 models

1DeepSeek V4.1 FlashDeepSeek65.4%
2DeepSeek V4 Pro 0813DeepSeek61.5%
3Ornith-1.5-397BOrnith AI59.5%
4Hy4 previewTencent · Open weight
5GLM-5.3Z.AI · Open weight
+24 more
react Native Evals

16 models

1Composer 2Cursor96.1%
2Composer 2 FastCursor94.9%
3GPT-5.4OpenAI85.3%
4GPT-5.5OpenAI · Closed
5Claude Opus 4.6Anthropic · Closed
+11 more
swe Verified Arcee

5 models

1Claude Opus 4.6Anthropic75.6%
2MiniMax M2.7MiniMax75.4%
3GLM-5Z.AI72.8%
4Kimi K2.5Moonshot AI · Open weight
5Trinity-Large-ThinkingArcee AI · Open weight
spider2 Lite

1 models

1Interfaze BetaInterfaze52.9%
sci Code

28 models

1Sakana FuguSakana AI60.1%
2Step 5 PreviewStepFun58.9%
3Sakana Fugu-UltraSakana AI58.7%
4Qwen3.7 MaxAlibaba · Closed
5Gemini 3.5 FlashGoogle · Closed
+23 more
aa Coding Index

111 models

1Claude Fable 5.1Anthropic81.6%
2Claude Opus 5Anthropic78.0%
3GPT-5.6 SolOpenAI77.4%
4GPT-6 AstraOpenAI · Closed
5Grok 4.6xAI · Closed
+106 more
aa Sci Code

103 models

1Claude Opus 5.5Anthropic66.9%
2Claude Fable 5.1Anthropic63.1%
3Claude Fable 5Anthropic61.0%
4MiMo-V2.6-ProXiaomi · Open weight
5Kimi K3Moonshot AI · Closed
+98 more

Agentic40 benchmarks

terminal Bench2

46 models

1GPT-5.6 SolOpenAI91.9%
2Claude Mythos 5Anthropic88.0%
3GPT-5.6 TerraOpenAI87.4%
4GPT-5.6 LunaOpenAI · Closed
5Claude Fable 5Anthropic · Closed
+41 more
browse Comp

44 models

1Atria Dawn PreviewShanghai Artificial Intelligence Laboratory92.5%
2GPT-5.6 SolOpenAI92.2%
3GPT-6 AstraOpenAI91.5%
4Kimi K3Moonshot AI · Closed
5Claude Opus 5Anthropic · Closed
+39 more
hle With Tools

20 models

1Claude Opus 5.5Anthropic67.7%
2Claude Opus 5Anthropic64.7%
3DeepSeek V4.1 FlashDeepSeek63.9%
4GLM-5.3Z.AI · Open weight
5DeepSeek V4 Pro 0813DeepSeek · Closed
+15 more
gdpval Aa

113 models

1Claude Opus 5Anthropic1862
2Claude Opus 5.5Anthropic1846
3GLM-5.3-FlashZ.AI1773
4GLM-5.3Z.AI · Open weight
5Muse Spark 1.3Meta · Closed
+108 more
gdpval Aa Normalized

116 models

1Claude Opus 5.5Anthropic67.3%
2Claude Fable 5.1Anthropic61.7%
3Claude Opus 5Anthropic60.4%
4Grok 4.7xAI · Closed
5MiMo-V2.6-ProXiaomi · Open weight
+111 more
aa Agentic Index

81 models

1Claude Fable 5.1Anthropic58.0%
2Claude Opus 5Anthropic56.2%
3Muse Spark 1.3Meta55.7%
4GLM-5.3Z.AI · Open weight
5Grok 4.6xAI · Closed
+76 more
apex Agents Aa

27 models

1Gemini 3.5 FlashGoogle47.1%
2Kimi K3Moonshot AI41.3%
3GPT-5.6 TerraOpenAI38.9%
4GPT-5.5OpenAI · Closed
5GPT-5.6 LunaOpenAI · Closed
+22 more
gert Labs

54 models

1Claude Opus 4.8Anthropic72.97%
2GPT-5.5OpenAI72.93%
3Claude Opus 4.7Anthropic65.59%
4GPT-5.4OpenAI · Closed
5Qwen3.7 MaxAlibaba · Closed
+49 more
os World Verified

34 models

1Qwen3.8 MaxAlibaba86.1%
2Claude Fable 5Anthropic85%
3Claude Mythos 5Anthropic85%
4Qwen3.8-27BAlibaba · Open weight
5Claude Opus 4.8Anthropic · Closed
+29 more
cyber Gym

26 models

1MiMo-V2.6-FlashXiaomi95.1%
2MiMo-V2.6-ProXiaomi94.0%
3DeepSeek V4.1 FlashDeepSeek88.1%
4Fugu CyberSakana AI · Closed
6Gemini 3.8 Flash CyberGoogle · Closed
+21 more
os World

2 models

1Claude Opus 4.5Anthropic66.3%
2Nemotron 3 Nano Omni 30B A3BNVIDIA47.4%
android World

9 models

1Qwen3.8-Omni-FlashAlibaba87.1%
2Qwen3.8 MaxAlibaba85.3%
3Qwen3.8-Flash-NextAlibaba84.5%
4Qwen3.8-27BAlibaba · Open weight
5Qwen3.7 PlusAlibaba · Closed
+4 more
web Voyager

2 models

1Fara1.5-27BMicrosoft89.3%
2Fara1.5-4BMicrosoft80.8%
mcp Atlas

38 models

1Muse Spark 1.1Meta88.1%
2Claude Opus 5Anthropic85.8%
3Step 5 PreviewStepFun85.6%
4Kimi K3Moonshot AI · Closed
5Hy4 previewTencent · Open weight
+33 more
toolathlon

22 models

1Muse Spark 1.1Meta75.6%
2Claude Opus 4.8Anthropic59.9%
3GPT-5.6 SolOpenAI58%
4Gemini 3.5 FlashGoogle · Closed
5GPT-5.5OpenAI · Closed
+17 more
z Claw Bench

0 models

tau2 Bench

148 models

2GPT-5.4OpenAIτ²-bench Telecom
4Claude Fable 5Anthropic · Closed98.5%
5GLM-5-TurboZ.AI · Closed98.5%
6GLM-5V-TurboZ.AI · Closed98.5%
7Step 3.7 FlashStepFun · Open weight98.5%
+143 more
deep Search Qa

19 models

1Atria Dawn PreviewShanghai Artificial Intelligence Laboratory96.0%
2Claude Opus 5Anthropic95.0%
3Kimi K3Moonshot AI95.0%
4Claude Opus 4.8Anthropic · Closed
5Step 3.7 FlashStepFun · Open weight
+14 more
tau2 Airline

0 models

pinch Bench

44 models

1Anthropic93.5%
2Qwen3.7 MaxAlibaba92.5%
3Claude Opus 4.8Anthropic90.5%
5MiMo-V2.5Xiaomi · Closed
6Grok Build 0.1xAI · Closed
+39 more
open Hands Index

33 models

1Claude Fable 5Anthropic81.0%
2Claude Opus 4.8Anthropic71.9%
3Claude Opus 4.7 (Adaptive)Anthropic69.7%
4Claude Opus 4.6Anthropic · Closed
5GPT-5.5OpenAI · Closed
+28 more
swe Atlas Refactoring

1 models

1OpenAI59.0%
inference Bench

28 models

4Claude Fable 5Anthropic · Closed8.74x
5Claude Opus 4.7Anthropic · Closed8.53x
6GPT-6 AstraOpenAI · Closed7.90x
7Claude Opus 4.8Anthropic · Closed7.60x
9GPT-5.6 SolOpenAI · Closed7.34x
+23 more
bfcl V4

22 models

1BTL-3Bad Theory Labs88.5%
2Atria Dawn PreviewShanghai Artificial Intelligence Laboratory77.0%
3Qwen3.7 MaxAlibaba75.0%
4BTL-4Bad Theory Labs · Open weight
5Ling 3.0 FlashInclusionAI · Open weight
+17 more
mle Bench Lite

3 models

1Atria Dawn PreviewShanghai Artificial Intelligence Laboratory86.2%
2MiniMax M2.7MiniMax66.6%
3Agents-A1-4BInternScience22.7%
mm Claw Bench

2 models

1MiniMax M2.7MiniMax62.7%
2MiMo-V2.5Xiaomi23.8%
claw Eval

26 models

1Claude Opus 4.6Anthropic70.4%
2Step 3.7 FlashStepFun68.3%
3Claude Sonnet 4.6Anthropic67.8%
4MiMo-V2.5-ProXiaomi · Closed
5Muse SparkMeta · Closed
+21 more
qwen Claw Bench

10 models

1Qwen3.7 MaxAlibaba64.3%
2Qwen3.7 PlusAlibaba61.8%
3Qwen 3.6 Max (preview)Alibaba59.0%
4Qwen3.6 PlusAlibaba · Closed
5Kimi K2.5Moonshot AI · Open weight
+5 more
qwen Web Bench

5 models

1Qwen3.7 MaxAlibaba1568
2Qwen3.7 PlusAlibaba1536
3Qwen 3.6 Max (preview)Alibaba1532
4Qwen3.6-27BAlibaba · Open weight
5Qwen3.6-35B-A3BAlibaba · Open weight
tau3 Bench

17 models

1Mercury 2.5Inceptionτ³-bench Telecom
2Mistral Medium 3.5 128BMistralτ³-bench Telecom
4Nemotron 3 UltraNVIDIA · Open weight70.9%
5Qwen3.6 PlusAlibaba · Closed70.7%
6GLM-5.1Z.AI · Open weight70.6%
+12 more
vita Bench

12 models

1Qwen3.7 MaxAlibaba47.9%
2Qwen3.7 PlusAlibaba45.6%
3Qwen3.6 PlusAlibaba44.3%
4Qwen3.5 397BAlibaba · Open weight
5Agents-A1-4BInternScience · Open weight
+7 more
deep Planning

7 models

1Qwen3.7 PlusAlibaba62.3%
2Qwen3.6 PlusAlibaba41.5%
3Qwen3.5 397BAlibaba37.6%
4Claude Opus 4.5Anthropic · Closed
5Qwen3.6-35B-A3BAlibaba · Open weight
+2 more
mcp Tasks

5 models

1Qwen3.5 397BAlibaba74.2%
2Qwen3.6 PlusAlibaba74.1%
3Claude Opus 4.5Anthropic71.8%
4GLM-5Z.AI · Open weight
5Kimi K2.5Moonshot AI · Open weight
wide Research

15 models

1Mercury 2Inception92.3%
2Hy4 previewTencent83.9%
3Qwen3.8 MaxAlibaba81.9%
5Kimi K2.6Moonshot AI · Open weight
6Ornith-1.5-397BOrnith AI · Open weight
+10 more
gaia

1 models

1Agents-A1-4BInternScience95.1%
tau Bench

0 models

web Arena

0 models

mewc

1 models

1MiniMax M2.5MiniMax74.4%
finance Agent V2

62 models

1Gemini 3.8 FlashGooglehigh reasoning
2Muse Spark 1.2Metaxhigh reasoning
3Metamax reasoning60.0%
4Gemini 3.7 FlashGoogle · Closed59.0%
5Muse Spark 1.3Meta · Closed58.9%
+57 more

Reasoning23 benchmarks

musr

0 models

bbh

3 models

3Soofi S 30B-A3BSoofi Project78.8%
4MiniCPM5-1BOpenBMB · Open weight
5Gemma 4 12BGoogle · Open weight
drop

2 models

3Celeris-1Celeris81.4%
4Soofi S 30B-A3BSoofi Project · Open weight
hellaswag

0 models

winogrande

0 models

cluewsc

0 models

lisan Bench

135 models

1Claude Opus 4.7 (Adaptive)Anthropic5122.60
2Claude Opus 5Anthropic5068.25
3Claude Fable 5Anthropic4561.82
4Claude Opus 4.6 (Adaptive)Anthropic · Closed
5Kimi K3Moonshot AI · Closed
+130 more
pp Bench

62 models

1Claude Fable 5Anthropic97.6%
2GPT-5.5OpenAI83.3%
3GPT-5.4OpenAI70.2%
4GPT-5.2OpenAI · Closed
5Claude Opus 4.7Anthropic · Closed
+57 more
long Bench V2

14 models

1Qwen3.8 MaxAlibaba66.3%
2Claude Opus 4.5Anthropic64.4%
3Qwen3.5 397BAlibaba63.2%
4Qwen3.6 PlusAlibaba · Closed
5Nemotron 3 UltraNVIDIA · Open weight
+9 more
mrcrv2

9 models

1Sakana Fugu-UltraSakana AI93.6%
2Qwen3.8 MaxAlibaba92.9%
3Qwen3.7 PlusAlibaba91.7%
4Qwen3.7 MaxAlibaba · Closed
5Sakana FuguSakana AI · Closed
+4 more
mrcrv2 64 128

2 models

1Gemini 3.7 FlashGoogle97%
2GPT-5.5OpenAI83.1%
mrcrv2 128 256

2 models

1GPT-5.5OpenAI87.5%
2Claude Opus 4.7 (Adaptive)Anthropic59.2%
graphwalks Bfs128k

1 models

1MAI-Thinking-1Microsoft90%
mrcr1m

4 models

1DeepSeek V4 Pro 0813DeepSeek83.5%
3DeepSeek V4 Flash 0731DeepSeek78.7%
5Muse Spark 1.1Meta · Closed
8Gemini 3.5 FlashGoogle · Closed
corpus Qa1m

2 models

1DeepSeek V4 Pro 0813DeepSeek62.0%
2DeepSeek V4 Flash 0731DeepSeek60.5%
arc Agi2

23 models

1GPT-6 AstraOpenAI95%
2GPT-5.6 SolOpenAI92.5%
3Claude Opus 5Anthropic90.4%
4Claude Fable 5.1Anthropic · Closed
5GPT-5.5OpenAI · Closed
+18 more
ai Needle

4 models

1Claude Opus 4.5Anthropic74%
2Qwen3.5 397BAlibaba68.7%
3Qwen3.6 PlusAlibaba68.3%
4GLM-5Z.AI · Open weight
gpqa Diamond

66 models

1GPT-6 AstraOpenAI96.0%
2Sakana Fugu-UltraSakana AI95.5%
3Sakana FuguSakana AI95.5%
4GPT-5.6 SolOpenAI · Closed
5Gemini 3.1 ProGoogle · Closed
+61 more
lcr

195 models

1Kimi K3Moonshot AI88.7%
2Step 5 PreviewStepFun88.3%
3MiMo-V2.6-ProXiaomi86.3%
4Claude Fable 5.1Anthropic · Closed
5Claude Opus 5.5Anthropic · Closed
+190 more
critpt

198 models

1GPT-5.6 SolOpenAI32.3%
2GPT-6 AstraOpenAI31.7%
3Claude Opus 5.5Anthropic31.7%
4GPT-6 SolOpenAI · Closed
5GPT-5.5 ProOpenAI · Closed
+193 more
bullshit Bench V2

96 models

1Claude Opus 4.8Anthropic95%
2Qwen3.8 MaxAlibaba95%
4Claude Sonnet 4.6Anthropic · Closed
5Claude Opus 4.5Anthropic · Closed
7Claude Opus 4.6Anthropic · Closed
+91 more
wild Bench

0 models

Knowledge37 benchmarks

mmlu

7 models

1o1OpenAI91.8%
2GPT-4.1OpenAI90.2%
5GPT-4.1 miniOpenAI · Closed
6Trinity-Large-PreviewArcee AI · Open weight
7o3-miniOpenAI · Closed
+2 more
gpqa

86 models

1GPT-6 AstraOpenAI96%
2Sakana Fugu-UltraSakana AI95.5%
3Sakana FuguSakana AI95.5%
4GPT-5.6 SolOpenAI · Closed
5Claude Opus 4.7 (Adaptive)Anthropic · Closed
+81 more
super Gpqa

20 models

1Claude Opus 4.6Anthropic95%
2Claude Sonnet 4.6Anthropic95%
3Qwen 3.6 Max (preview)Alibaba73.9%
4Qwen3.7 MaxAlibaba · Closed
5Qwen3.6 PlusAlibaba · Closed
+15 more
mmlu Pro

46 models

1Qwen3.7 MaxAlibaba89.6%
2Claude Opus 4.5Anthropic89.5%
3Qwen3.7 PlusAlibaba88.5%
4Qwen3.6 PlusAlibaba · Closed
5Qwen3.5 397BAlibaba · Open weight
+41 more
agieval

1 models

3Soofi S 30B-A3BSoofi Project66.9%
hle

59 models

1Claude Fable 5.1Anthropic65%
2Claude Opus 5Anthropic64.7%
3Claude Mythos 5Anthropic64.5%
4Muse Spark 1.1Meta · Closed
5GPT-5.4 ProOpenAI · Closed
+54 more
frontier Science

1 models

1GPT-5.4 ProOpenAI36.7%
artificial Analysis

208 models

1GPT-5.6 SolOpenAI58.9%
2Claude Opus 5.5Anthropic57.6%
3GPT-5.6 TerraOpenAI55.0%
4Claude Fable 5.1Anthropic · Closed
5DeepSeek V4 Pro 0813DeepSeek · Closed
+203 more
aa Gpqa Diamond

198 models

1GPT-6 AstraOpenAI96.1%
2Gemini 3.8 FlashGoogle95.3%
3Grok 4.6xAI94.9%
4Gemini 3.7 FlashGoogle · Closed
5GPT-5.6 SolOpenAI · Closed
+193 more
aa Hle

203 models

1Claude Opus 5.5Anthropic61.4%
2Claude Fable 5.1Anthropic59.1%
3Claude Fable 5Anthropic55.5%
4Claude Opus 5Anthropic · Closed
5GPT-6 AstraOpenAI · Closed
+198 more
aa Omniscience Index

193 models

1Claude Opus 5.5Anthropic46.4%
2Claude Fable 5.1Anthropic43.5%
3GPT-6 AstraOpenAI43.4%
4Claude Fable 5Anthropic · Closed
5Claude Opus 5Anthropic · Closed
+188 more
omniscience Accuracy

194 models

1Claude Fable 5.1Anthropic67.2%
2Claude Opus 5.5Anthropic66.2%
3Claude Fable 5Anthropic65.4%
4GPT-6 AstraOpenAI · Closed
5Claude Opus 5Anthropic · Closed
+189 more
omniscience Hallucination Rate

194 models

1Command A+Cohere14.2%
2LFM2.5-2.6BLiquidAI16.0%
3MiniMax M3MiniMax18.4%
4Quasar 438BMultiverse Computing · Closed
5MiniCPM5-2BOpenBMB · Open weight
+189 more
simple Qa

3 models

1DeepSeek V4 Pro 0813DeepSeek57.9%
5DeepSeek V4 Flash 0731DeepSeek · Closed
6MAI-Thinking-1Microsoft · Closed
chinese Simple Qa

2 models

1DeepSeek V4 Pro 0813DeepSeek84.4%
2DeepSeek V4 Flash 0731DeepSeek78.9%
open Book Qa

0 models

health Bench Hard

11 models

1Muse SparkMeta42.8%
2GPT-5.4OpenAI40.1%
3GPT-6 AstraOpenAI36.6%
4GPT-5.6 SolOpenAI · Closed
5GPT-5.6 TerraOpenAI · Closed
+6 more
med Xpert Qa Text

5 models

1Gemini 3.1 ProGoogle71.5%
2GPT-5.4OpenAI59.6%
3Muse SparkMeta52.6%
4Claude Opus 4.6Anthropic · Closed
5Grok 4.20xAI · Closed
frontier Science Research

4 models

1Apodex 1.1Apodex63.3%
2Apodex 1.1 MiniApodex51.7%
3GPT-5.4 ProOpenAI36.7%
4Agents-A1-4BInternScience · Open weight
truthfulqa

0 models

hle No Tools

39 models

1Claude Opus 5.5Anthropic64.4%
2Claude Fable 5.1Anthropic60.9%
3Claude Mythos 5Anthropic59%
4Claude Opus 5Anthropic · Closed
5Muse Spark 1.1Meta · Closed
+34 more
mmlu Pro Arcee

6 models

1Claude Opus 4.6Anthropic89.1%
2Kimi K2.5Moonshot AI87.1%
3GLM-5Z.AI85.8%
4Trinity-Large-ThinkingArcee AI · Open weight
5MiniMax M2.7MiniMax · Open weight
+1 more
mmlu Redux

11 models

1Claude Opus 4.5Anthropic96.6%
2Qwen3.7 MaxAlibaba95%
3Qwen3.5 397BAlibaba94.9%
4Qwen3.7 PlusAlibaba · Closed
5Qwen3.6 PlusAlibaba · Closed
+6 more
mmmlu

5 models

1Interfaze BetaInterfaze90.9%
2Qwen3.7 MaxAlibaba90.3%
4Qwen3.7 PlusAlibaba · Closed
6K-EXAONE 2.0LG AI Research · Open weight
7Gemma 4 12BGoogle · Open weight
c Eval

6 models

1Qwen3.6 PlusAlibaba93.3%
3Qwen3.5 397BAlibaba93%
4Claude Opus 4.5Anthropic · Closed
6Qwen3.6-27BAlibaba · Open weight
7Qwen3.6-35B-A3BAlibaba · Open weight
+1 more
cmmlu

1 models

3LongCat-Flash-Lite-SparseMeituan84.3%
multi Lo Ko

0 models

trivia Qa

0 models

kmmlu

2 models

1Kanana-2 3B InstructKakao43.3%
2Kanana-2 1.3B InstructKakao42.8%
kmmlu Hard

0 models

kmmlu Redux

0 models

kmmlu Pro

4 models

1A.X K2SK Telecom80.5%
2Solar Pro 4Upstage79.2%
3Solar Open 2Upstage78.4%
4K-EXAONE 2.0LG AI Research · Open weight
click

3 models

1A.X K2SK Telecom91.6%
2Solar Open 2Upstage90.7%
3K-EXAONE 2.0LG AI Research84.2%
kobalt

1 models

1A.X K2SK Telecom73%
korean Csat

0 models

hrm8k

1 models

1Solar Open 2Upstage92.2%

Multimodal45 benchmarks

mmmu

11 models

1Qwen3.6 PlusAlibaba86.0%
2Qwen3.5-122B-A10BAlibaba83.9%
3Qwen3.6-27BAlibaba82.9%
4Qwen3.5-27BAlibaba · Open weight
5Qwen3.6-35B-A3BAlibaba · Open weight
+6 more
mmmu Pro

42 models

1Gemini 3.1 ProGoogle83.9%
2Gemini 3.5 FlashGoogle83.6%
3GPT-5.6 SolOpenAI83%
4Qwen3.8 MaxAlibaba · Open weight
5Kimi K3Moonshot AI · Closed
+37 more
aa Mmmu Pro

110 models

1Claude Opus 5.5Anthropic87.7%
2GPT-6 AstraOpenAI86.9%
3Gemini 3.8 FlashGoogle85.6%
4Gemini 3.7 FlashGoogle · Closed
5Claude Opus 5Anthropic · Closed
+105 more
ocr Bench V2

5 models

1Qwen3.8 MaxAlibaba74.2%
2Qwen3.7 PlusAlibaba70.7%
3Interfaze BetaInterfaze70.7%
4Ternary Bonsai 2 27BPrism ML · Open weight
5LFM2.5-VL-3BLiquidAI · Open weight
olm Ocr

1 models

1Interfaze BetaInterfaze85.7%
vox Populi Wer

1 models

1Interfaze BetaInterfaze2.4%
design Arena Website

93 models

1Muse Spark 1.3Meta1364
2Kimi K3Moonshot AI1350
3Claude Fable 5.1Anthropic1320
4Claude Opus 5Anthropic · Closed
5Muse Spark 1.2Meta · Closed
+88 more
office Qa Pro

12 models

1Claude Opus 5.5Anthropic67.7%
2Claude Opus 5Anthropic66.9%
3Claude Opus 4.8Anthropic66.2%
4Hy4 previewTencent · Open weight
5Kimi K3Moonshot AI · Closed
+7 more
mmmu Pro Python

9 models

1GPT-5.6 SolOpenAI84.6%
2Kimi K3Moonshot AI83.4%
3GPT-5.5OpenAI83.2%
4GPT-5.4OpenAI · Closed
5GPT-5.6 TerraOpenAI · Closed
+4 more
omni Doc Bench15

6 models

1Qwen3.8 MaxAlibaba92.1%
2MiniMax M3MiniMax91.6%
3Qwen3.7 PlusAlibaba91.4%
4Qwen3.8-27BAlibaba · Open weight
5Qwen3.6-35B-A3BAlibaba · Open weight
+1 more
real World Qa

12 models

1Qwen3.8-Flash-NextAlibaba88.5%
2Qwen3.8 MaxAlibaba88.0%
3Qwen3.8-Omni-FlashAlibaba87.7%
4Qwen3.7 PlusAlibaba · Closed
5Qwen3.8-27BAlibaba · Open weight
+7 more
video Mme With Sub

6 models

1Qwen3.8 MaxAlibaba90.4%
2Qwen3.7 PlusAlibaba88.0%
3Qwen3.6-27BAlibaba87.7%
4MiMo-V2.5Xiaomi · Closed
5Qwen3.6-35B-A3BAlibaba · Open weight
+1 more
video Mme No Sub

2 models

1Qwen3.6-35B-A3BAlibaba82.5%
2Nemotron 3 Nano Omni 30B A3BNVIDIA72.2%
video Mme

3 models

1Seed 2.1 ProByteDance89.2%
2Seed 2.1 TurboByteDance89.0%
3Kimi K2.5Moonshot AI87.4%
math Vision

19 models

1Qwen3.8 MaxAlibaba95.2%
2Kimi K3Moonshot AI94.3%
3Seed 2.1 ProByteDance92.6%
4Qwen3.8-Omni-FlashAlibaba · Closed
5Qwen3.8-Flash-NextAlibaba · Open weight
+14 more
we Math

0 models

dyna Math

1 models

1Qwen3.6-27BAlibaba85.6%
m Star

1 models

1Qwen3.6-27BAlibaba81.4%
chat Cvqa

0 models

mm Long Bench Doc

1 models

1Nemotron 3 Nano Omni 30B A3BNVIDIA57.5%
cc Ocr

3 models

1Qwen3.6-35B-A3BAlibaba81.9%
2Qwen3.6-27BAlibaba81.2%
3Qwen3.8 MaxAlibaba79.6%
ai2d Test

3 models

1Qwen3.6-35B-A3BAlibaba92.7%
2Nemotron 3 Nano Omni 30B A3BNVIDIA88.5%
3ZAYA1-VL-8BZyphra87.5%
count Bench

4 models

1Qwen3.6-27BAlibaba97.8%
2ZAYA1-VL-8BZyphra88.1%
3LFM2.5-VL-3BLiquidAI87.3%
4LFM2.5-VL-450MLiquidAI · Open weight
refcoco Avg

6 models

1Qwen3.6-27BAlibaba92.5%
2Qwen3.6-35B-A3BAlibaba92.0%
3Nemotron 3 Nano Omni 30B A3BNVIDIA90.5%
4LFM2.5-VL-3BLiquidAI · Open weight
5ZAYA1-VL-8BZyphra · Open weight
+1 more
odinw13

2 models

1Qwen3.7 PlusAlibaba51.1%
2Qwen3.6-35B-A3BAlibaba50.8%
erqa

13 models

1Qwen3.8 MaxAlibaba77.8%
2Qwen3.8-Flash-NextAlibaba72.3%
3Seed 2.1 ProByteDance72.0%
4Seed 2.1 TurboByteDance · Closed
5Qwen3.8-Omni-FlashAlibaba · Closed
+8 more
video Mmmu

11 models

1Qwen3.8 MaxAlibaba88.7%
2Gemini 3 ProGoogle87.6%
3dots3-note PreviewDots Studio86.8%
4Kimi K2.5Moonshot AI · Open weight
5Qwen3.7 PlusAlibaba · Closed
+6 more
mlvu Avg

4 models

1Qwen3.8 MaxAlibaba90.8%
2Qwen3.7 PlusAlibaba87.4%
3Qwen3.6-27BAlibaba86.6%
4Qwen3.6-35B-A3BAlibaba · Open weight
mmvu

7 models

1Qwen3.8 MaxAlibaba82.4%
2GLM-5.3-FlashZ.AI80.5%
3Kimi K2.5Moonshot AI80.4%
4dots3-note PreviewDots Studio · Open weight
5Qwen3.5-122B-A10BAlibaba · Open weight
+2 more
screen Spot Pro

18 models

1GPT-6 AstraOpenAI92.7%
2Claude Opus 4.8Anthropic87.9%
3GPT-5.4OpenAI85.4%
4Qwen3.8 MaxAlibaba · Open weight
5Gemini 3.1 ProGoogle · Closed
+13 more
tir Bench

0 models

med Xpert Qa Mm

8 models

1Gemini 3.1 ProGoogle81.3%
2Qwen3.8 MaxAlibaba80.4%
3Muse SparkMeta78.4%
4GPT-5.4OpenAI · Closed
5Qwen3.7 PlusAlibaba · Closed
+3 more
zero Bench

8 models

1GPT-5.4OpenAI41.0%
2Muse SparkMeta33.0%
3Gemini 3.1 ProGoogle29.0%
4Qwen3.8 MaxAlibaba · Open weight
5Kimi K3Moonshot AI · Closed
+3 more
design2 Code

0 models

vision2 Web

4 models

1Qwen3.8 MaxAlibaba69.0%
2Qwen3.8-Flash-NextAlibaba64.0%
3Qwen3.8-27BAlibaba62.9%
4Qwen3.8-Omni-FlashAlibaba · Closed
image Mining

0 models

mm Search

0 models

mm Search Plus

1 models

1Qwen3.7 PlusAlibaba41.4%
simple Vqa

11 models

1Qwen3.7 PlusAlibaba81.7%
2Step 3.7 FlashStepFun79.2%
3Qwen3.8 MaxAlibaba75.0%
4dots3-note PreviewDots Studio · Open weight
5Gemini 3.1 ProGoogle · Closed
+6 more
facts Vlm

0 models

v Star

11 models

1Kimi K2.6Moonshot AI96.9%
2Qwen3.6 PlusAlibaba96.9%
3Qwen3.5 397BAlibaba95.8%
4Step 3.7 FlashStepFun · Open weight
5Qwen3.6-27BAlibaba · Open weight
+6 more
charxiv

39 models

1Qwen3.8 MaxAlibaba93.5%
2Claude Mythos 5Anthropic93.5%
3Qwen3.8-Omni-FlashAlibaba91.4%
4Kimi K3Moonshot AI · Closed
5Claude Opus 4.7 (Adaptive)Anthropic · Closed
+34 more
charxiv No Tools

14 models

1Claude Mythos 5Anthropic88.9%
2Qwen3.8 MaxAlibaba88.4%
3Gemini 3.8 FlashGoogle86.2%
4Kimi K3Moonshot AI · Closed
5Qwen3.8-Flash-NextAlibaba · Open weight
+9 more
blueprint Bench2

26 models

1GPT-6 AstraOpenAI49.7%
2Claude Fable 5.1Anthropic41.9%
3Claude Fable 5Anthropic38.6%
4Gemini 3.8 FlashGoogle · Closed
5GPT-5.5OpenAI · Closed
+21 more

Math23 benchmarks

aime2023

0 models

aime2024

1 models

1o3-miniOpenAI87.3%
aime2025

18 models

1MAI-Thinking-1Microsoft97%
2Kimi K2.5Moonshot AI96.1%
3Kimi K2.5 (Reasoning)Moonshot AI96.1%
4GLM-4.7Z.AI · Open weight
5Ternary Bonsai 2 27BPrism ML · Open weight
+13 more
gsm8k

3 models

1Ternary Bonsai 2 27BPrism ML96.7%
2Celeris-1Celeris93.7%
5Soofi S 30B-A3BSoofi Project · Open weight
cmath

0 models

aime2025 Arcee

6 models

1Claude Opus 4.6Anthropic99.8%
2Kimi K2.5Moonshot AI96.3%
3Trinity-Large-ThinkingArcee AI96.3%
4GLM-5Z.AI · Open weight
5MiniMax M2.7MiniMax · Open weight
+1 more
hmmt2023

0 models

hmmt2024

0 models

hmmt2025

0 models

brumo2025

0 models

math500

7 models

1Ternary Bonsai 2 27BPrism ML98.8%
2LongCat-Flash-Lite-SparseMeituan95.8%
3MiniCPM5-2BOpenBMB94.6%
4MiniCPM5-1BOpenBMB · Open weight
5LFM2.5-8B-A1BLiquidAI · Open weight
+2 more
aime2026

28 models

1GLM-5.2Z.AI99.2%
2InklingThinking Machines Lab97.1%
3A.X K2SK Telecom97.1%
4Kimi K2.6Moonshot AI · Open weight
5Ternary Bonsai 2 27BPrism ML · Open weight
+23 more
ipho2025 Theory

1 models

1GPT-5.4 ProOpenAI93.5%
hmmt Feb2025

10 models

1GLM-5Z.AI97.5%
2Qwen3.6 PlusAlibaba96.7%
3Kimi K2.5Moonshot AI95.4%
4Qwen3.5 397BAlibaba · Open weight
5Qwen3.6-27BAlibaba · Open weight
+5 more
hmmt Nov2025

9 models

1GLM-5Z.AI96.9%
2Qwen3.6 PlusAlibaba94.6%
3GLM-5.2Z.AI94.4%
4GLM-5.1Z.AI · Open weight
5Claude Opus 4.5Anthropic · Closed
+4 more
hmmt Feb2026

23 models

1Qwen3.7 MaxAlibaba97.1%
2DeepSeek V4 Pro 0813DeepSeek95.2%
3DeepSeek V4 Flash 0731DeepSeek94.8%
5Solar Open 2Upstage · Open weight
6Qwen3.7 PlusAlibaba · Closed
+18 more
imo Answer Bench

9 models

1dots3-note PreviewDots Studio90.9%
2Qwen3.7 MaxAlibaba90.0%
3DeepSeek V4 Pro 0813DeepSeek89.8%
4DeepSeek V4 Flash 0731DeepSeek · Closed
6Qwen3.7 PlusAlibaba · Closed
+4 more
apex

8 models

1Hy4 previewTencent74.2%
2DeepSeek V4.1 FlashDeepSeek65.6%
3A.X K2SK Telecom45.8%
4Qwen3.7 MaxAlibaba · Closed
5DeepSeek V4 Pro 0813DeepSeek · Closed
+3 more
apex Shortlist

3 models

1DeepSeek V4 Pro 0813DeepSeek90.2%
2A.X K2SK Telecom88.6%
3DeepSeek V4 Flash 0731DeepSeek85.7%
mm Answer Bench

10 models

1GLM-5.2Z.AI91.0%
2Kimi K2.6Moonshot AI86.0%
3Claude Opus 4.5Anthropic84.0%
4GLM-5.1Z.AI · Open weight
5Qwen3.6 PlusAlibaba · Closed
+5 more
frontier Math

7 models

1GPT-5.6 SolOpenAI89%
2GPT-5.6 TerraOpenAI84.9%
3GPT-5.6 LunaOpenAI78.6%
4GPT-5.5 ProOpenAI · Closed
5GPT-5.5OpenAI · Closed
+2 more
usamo2026

3 models

1Claude Mythos 5Anthropic97.6%
2Claude Opus 4.8Anthropic96.7%
3MiniMax M3MiniMax85.7%

Multilingual7 benchmarks

mgsm

0 models

mmlu Pro X

12 models

1Qwen3.7 MaxAlibaba87%
2Claude Opus 4.5Anthropic85.7%
3Qwen3.7 PlusAlibaba85.4%
4Qwen3.6 PlusAlibaba · Closed
5Qwen3.5 397BAlibaba · Open weight
+7 more
nova63

7 models

1Qwen3.5 397BAlibaba59.1%
2Qwen3.7 MaxAlibaba59.0%
3Qwen3.7 PlusAlibaba58.8%
4Qwen3.6 PlusAlibaba · Closed
5Claude Opus 4.5Anthropic · Closed
+2 more
include

4 models

1Claude Opus 5Anthropic89.8%
2Claude Opus 4.8Anthropic87.6%
3Qwen3.7 MaxAlibaba86.2%
4Qwen3.7 PlusAlibaba · Closed
poly Math

3 models

1Qwen3.7 MaxAlibaba86.5%
2Qwen3.7 PlusAlibaba84.0%
3K-EXAONE 2.0LG AI Research71.3%
vwt2k Lite

0 models

maxife

2 models

1Qwen3.7 MaxAlibaba89.2%
2Qwen3.7 PlusAlibaba88.8%

Instruction Following4 benchmarks

ifeval

30 models

4Qwen3.7 PlusAlibaba · Closed94.6%
5Qwen3.7 MaxAlibaba · Closed94.3%
6Qwen3.6 PlusAlibaba · Closed94.3%
7Kimi K2.5Moonshot AI · Open weight93.9%
8dots3-note PreviewDots Studio · Open weight93.9%
+25 more
if Bench

43 models

1MAI-Thinking-1Microsoft85%
2Qwen3.8 MaxAlibaba82.8%
3Inkling-SmallThinking Machines Lab82.2%
4Nemotron 3 UltraNVIDIA · Open weight
5Qwen3.8-Omni-FlashAlibaba · Closed
+38 more
aa If Bench

147 models

1MiniMax M3MiniMax82.9%
2Nemotron 3 UltraNVIDIA81.4%
3Grok 4.3xAI81.3%
4Qwen3.7 MaxAlibaba · Closed
5MiMo-V2.5-ProXiaomi · Closed
+142 more
sob Value Acc

1 models

1Interfaze BetaInterfaze79.5%

External15 benchmarks

vals Index

59 models

1Claude Fable 5.1Anthropic68.83%
2Claude Opus 5Anthropic67.21%
3GPT-6 AstraOpenAImax reasoning
4Claude Opus 5.5Anthropic · Closed
5Claude Fable 5Anthropic · Closed
+54 more
vals Multimodal Index

33 models

1Claude Fable 5Anthropic74.15%
2Claude Opus 5Anthropic73.90%
3Kimi K3Moonshot AI73.42%
4GPT-5.6 SolOpenAI · Closed72.64%
5Claude Opus 4.8Anthropic · Closed
+28 more
vals Corp Fin V2

131 models

1Claude Opus 5Anthropic73.19%
2Claude Fable 5Anthropic71.83%
3Kimi K3Moonshot AI71.56%
4Muse Spark 1.1Meta · Closed71.29%
5Muse Spark 1.2Meta · Closed70.94%
+126 more
vals Med Code

94 models

1Claude Opus 5Anthropic63.57%
2Google59.06%
3Claude Fable 5Anthropic56.07%
4Gemini 3 Flash PreviewGoogle
5Gemini 3.5 FlashGoogle · Closed
+89 more
vals Med Scribe

96 models

1Claude Opus 5.5Anthropic91.43%
2Claude Fable 5.1Anthropic91.29%
3Claude Opus 5Anthropic90.98%
4Muse Spark 1.2Meta · Closed
5Grok 4.7xAI · Closed
+91 more
vals Mortgage Tax

97 models

1Claude Opus 5Anthropic72.06%
2Claude Fable 5.1Anthropic70.79%
3Claude Opus 4.7Anthropic70.27%
4Claude Sonnet 5Anthropic · Closed
5Claude Opus 4.8Anthropic · Closed
+92 more
vals Proof Bench

35 models

1Claude Opus 5.5Anthropic100.00%
2Claude Fable 5.1Anthropic100.00%
3logicalintelligence100.00%
4GPT-6 AstraOpenAI · Closed
5Claude Opus 5Anthropic · Closed
+30 more
vals Legal Bench

144 models

1Claude Fable 5Anthropic88.56%
2Claude Fable 5.1Anthropic88.51%
3Googlehigh reasoning87.40%
4Gemini 3.7 FlashGoogle · Closed87.26%
5Gemini 3 Pro PreviewGoogle87.03%
+139 more
vals Case Law V2

53 models

1Grok 4.3xAI79.31%
2GPT-5.1OpenAI73.42%
3GPT-4.1OpenAI69.88%
4GPT-5 miniOpenAI · Closed
5Claude Opus 4.7Anthropic · Closed
+48 more
deep Swe

25 models

4GPT-5.6 SolOpenAI · Closed72.7%
5Claude Fable 5Anthropic · Closed69.7%
6GPT-5.6 TerraOpenAI · Closed69.6%
7GLM-5.3Z.AI · Open weight69.0%
8Kimi K3Moonshot AI · Closed68.5%
+20 more
vals Swe Bench

87 models

1Claude Opus 5Anthropic97.0%
2DeepSeek V4 Pro 0813DeepSeekmax reasoning
3GPT-5.6 SolOpenAImax reasoning
4Grok 4.6xAI · Closed95.6%
5GPT-5.6 TerraOpenAI · Closed95.4%
+82 more
vals Terminal Bench2

66 models

1GPT-5.5OpenAIhigh reasoning
2Claude Opus 4.8Anthropic70.04%
3Claude Opus 4.7Anthropic68.54%
4Gemini 3.5 FlashGoogle · Closed67.42%
5Gemini 3.1 Pro PreviewGoogle67.42%
+61 more
vals Live Code Bench

142 models

1Claude Fable 5.1Anthropic90.5%
2Claude Fable 5Anthropic89.8%
3Gemini 3.8 FlashGooglehigh reasoning
4Claude Opus 5Anthropic · Closed
5Gemini 3.7 FlashGoogle · Closed88.7%
+137 more
vals Gpqa Diamond

135 models

1Googlehigh reasoning95.5%
2GPT-5.6 SolOpenAImax reasoning
3Grok 4.6xAIhigh reasoning
4Gemini 3.8 FlashGoogle · Closed94.4%
5Gemini 3.7 FlashGoogle · Closed93.9%
+130 more
vals Mmlu Pro

135 models

1Claude Fable 5.1Anthropic92.4%
2Claude Opus 5Anthropic91.6%
3Claude Fable 5Anthropic91.5%
4Gemini 3.1 Pro PreviewGoogle91.0%
5Gemini 3.8 FlashGoogle · Closed90.2%
+130 more