BenchLM Benchmarks
219 benchmarks · 528 model scores · Data from Sep 23, 2026
Multimodal45 benchmarks
mmmu
11 models
1Qwen3.6 PlusAlibaba86.0%
2Qwen3.5-122B-A10BAlibaba83.9%
3Qwen3.6-27BAlibaba82.9%
4Qwen3.5-27BAlibaba · Open weight
5Qwen3.6-35B-A3BAlibaba · Open weight
+6 moremmmu Pro
42 models
1Gemini 3.1 ProGoogle83.9%
2Gemini 3.5 FlashGoogle83.6%
3GPT-5.6 SolOpenAI83%
4Qwen3.8 MaxAlibaba · Open weight
5Kimi K3Moonshot AI · Closed
+37 moreaa Mmmu Pro
110 models
1Claude Opus 5.5Anthropic87.7%
2GPT-6 AstraOpenAI86.9%
3Gemini 3.8 FlashGoogle85.6%
4Gemini 3.7 FlashGoogle · Closed
5Claude Opus 5Anthropic · Closed
+105 moreocr Bench V2
5 models
1Qwen3.8 MaxAlibaba74.2%
2Qwen3.7 PlusAlibaba70.7%
3Interfaze BetaInterfaze70.7%
4Ternary Bonsai 2 27BPrism ML · Open weight
5LFM2.5-VL-3BLiquidAI · Open weight
design Arena Website
93 models
1Muse Spark 1.3Meta1364
2Kimi K3Moonshot AI1350
3Claude Fable 5.1Anthropic1320
4Claude Opus 5Anthropic · Closed
5Muse Spark 1.2Meta · Closed
+88 moreoffice Qa Pro
12 models
1Claude Opus 5.5Anthropic67.7%
2Claude Opus 5Anthropic66.9%
3Claude Opus 4.8Anthropic66.2%
4Hy4 previewTencent · Open weight
5Kimi K3Moonshot AI · Closed
+7 moremmmu Pro Python
9 models
1GPT-5.6 SolOpenAI84.6%
2Kimi K3Moonshot AI83.4%
3GPT-5.5OpenAI83.2%
4GPT-5.4OpenAI · Closed
5GPT-5.6 TerraOpenAI · Closed
+4 moreomni Doc Bench15
6 models
1Qwen3.8 MaxAlibaba92.1%
2MiniMax M3MiniMax91.6%
3Qwen3.7 PlusAlibaba91.4%
4Qwen3.8-27BAlibaba · Open weight
5Qwen3.6-35B-A3BAlibaba · Open weight
+1 morereal World Qa
12 models
1Qwen3.8-Flash-NextAlibaba88.5%
2Qwen3.8 MaxAlibaba88.0%
3Qwen3.8-Omni-FlashAlibaba87.7%
4Qwen3.7 PlusAlibaba · Closed
5Qwen3.8-27BAlibaba · Open weight
+7 morevideo Mme With Sub
6 models
1Qwen3.8 MaxAlibaba90.4%
2Qwen3.7 PlusAlibaba88.0%
3Qwen3.6-27BAlibaba87.7%
4MiMo-V2.5Xiaomi · Closed
5Qwen3.6-35B-A3BAlibaba · Open weight
+1 moremath Vision
19 models
1Qwen3.8 MaxAlibaba95.2%
2Kimi K3Moonshot AI94.3%
3Seed 2.1 ProByteDance92.6%
4Qwen3.8-Omni-FlashAlibaba · Closed
5Qwen3.8-Flash-NextAlibaba · Open weight
+14 morewe Math
0 models
chat Cvqa
0 models
ai2d Test
3 models
1Qwen3.6-35B-A3BAlibaba92.7%
2Nemotron 3 Nano Omni 30B A3BNVIDIA88.5%
3ZAYA1-VL-8BZyphra87.5%
count Bench
4 models
1Qwen3.6-27BAlibaba97.8%
2ZAYA1-VL-8BZyphra88.1%
3LFM2.5-VL-3BLiquidAI87.3%
4LFM2.5-VL-450MLiquidAI · Open weight
refcoco Avg
6 models
1Qwen3.6-27BAlibaba92.5%
2Qwen3.6-35B-A3BAlibaba92.0%
3Nemotron 3 Nano Omni 30B A3BNVIDIA90.5%
4LFM2.5-VL-3BLiquidAI · Open weight
5ZAYA1-VL-8BZyphra · Open weight
+1 moreerqa
13 models
1Qwen3.8 MaxAlibaba77.8%
2Qwen3.8-Flash-NextAlibaba72.3%
3Seed 2.1 ProByteDance72.0%
4Seed 2.1 TurboByteDance · Closed
5Qwen3.8-Omni-FlashAlibaba · Closed
+8 morevideo Mmmu
11 models
1Qwen3.8 MaxAlibaba88.7%
2Gemini 3 ProGoogle87.6%
3dots3-note PreviewDots Studio86.8%
4Kimi K2.5Moonshot AI · Open weight
5Qwen3.7 PlusAlibaba · Closed
+6 moremlvu Avg
4 models
1Qwen3.8 MaxAlibaba90.8%
2Qwen3.7 PlusAlibaba87.4%
3Qwen3.6-27BAlibaba86.6%
4Qwen3.6-35B-A3BAlibaba · Open weight
mmvu
7 models
1Qwen3.8 MaxAlibaba82.4%
2GLM-5.3-FlashZ.AI80.5%
3Kimi K2.5Moonshot AI80.4%
4dots3-note PreviewDots Studio · Open weight
5Qwen3.5-122B-A10BAlibaba · Open weight
+2 morescreen Spot Pro
18 models
1GPT-6 AstraOpenAI92.7%
2Claude Opus 4.8Anthropic87.9%
3GPT-5.4OpenAI85.4%
4Qwen3.8 MaxAlibaba · Open weight
5Gemini 3.1 ProGoogle · Closed
+13 moretir Bench
0 models
med Xpert Qa Mm
8 models
1Gemini 3.1 ProGoogle81.3%
2Qwen3.8 MaxAlibaba80.4%
3Muse SparkMeta78.4%
4GPT-5.4OpenAI · Closed
5Qwen3.7 PlusAlibaba · Closed
+3 morezero Bench
8 models
1GPT-5.4OpenAI41.0%
2Muse SparkMeta33.0%
3Gemini 3.1 ProGoogle29.0%
4Qwen3.8 MaxAlibaba · Open weight
5Kimi K3Moonshot AI · Closed
+3 moredesign2 Code
0 models
flame Vlm Code
0 models
vision2 Web
4 models
1Qwen3.8 MaxAlibaba69.0%
2Qwen3.8-Flash-NextAlibaba64.0%
3Qwen3.8-27BAlibaba62.9%
4Qwen3.8-Omni-FlashAlibaba · Closed
image Mining
0 models
mm Search
0 models
simple Vqa
11 models
1Qwen3.7 PlusAlibaba81.7%
2Step 3.7 FlashStepFun79.2%
3Qwen3.8 MaxAlibaba75.0%
4dots3-note PreviewDots Studio · Open weight
5Gemini 3.1 ProGoogle · Closed
+6 morefacts Vlm
0 models
v Star
11 models
1Kimi K2.6Moonshot AI96.9%
2Qwen3.6 PlusAlibaba96.9%
3Qwen3.5 397BAlibaba95.8%
4Step 3.7 FlashStepFun · Open weight
5Qwen3.6-27BAlibaba · Open weight
+6 morecharxiv
39 models
1Qwen3.8 MaxAlibaba93.5%
2Claude Mythos 5Anthropic93.5%
3Qwen3.8-Omni-FlashAlibaba91.4%
4Kimi K3Moonshot AI · Closed
5Claude Opus 4.7 (Adaptive)Anthropic · Closed
+34 morecharxiv No Tools
14 models
1Claude Mythos 5Anthropic88.9%
2Qwen3.8 MaxAlibaba88.4%
3Gemini 3.8 FlashGoogle86.2%
4Kimi K3Moonshot AI · Closed
5Qwen3.8-Flash-NextAlibaba · Open weight
+9 moreblueprint Bench2
26 models
1GPT-6 AstraOpenAI49.7%
2Claude Fable 5.1Anthropic41.9%
3Claude Fable 5Anthropic38.6%
4Gemini 3.8 FlashGoogle · Closed
5GPT-5.5OpenAI · Closed
+21 more