context.vn
Menu

BenchLM Benchmarks

219 benchmarks · 528 model scores · Data from Sep 23, 2026

Multimodal45 benchmarks

mmmu

11 models

1Qwen3.6 PlusAlibaba86.0%
2Qwen3.5-122B-A10BAlibaba83.9%
3Qwen3.6-27BAlibaba82.9%
4Qwen3.5-27BAlibaba · Open weight
5Qwen3.6-35B-A3BAlibaba · Open weight
+6 more
mmmu Pro

42 models

1Gemini 3.1 ProGoogle83.9%
2Gemini 3.5 FlashGoogle83.6%
3GPT-5.6 SolOpenAI83%
4Qwen3.8 MaxAlibaba · Open weight
5Kimi K3Moonshot AI · Closed
+37 more
aa Mmmu Pro

110 models

1Claude Opus 5.5Anthropic87.7%
2GPT-6 AstraOpenAI86.9%
3Gemini 3.8 FlashGoogle85.6%
4Gemini 3.7 FlashGoogle · Closed
5Claude Opus 5Anthropic · Closed
+105 more
ocr Bench V2

5 models

1Qwen3.8 MaxAlibaba74.2%
2Qwen3.7 PlusAlibaba70.7%
3Interfaze BetaInterfaze70.7%
4Ternary Bonsai 2 27BPrism ML · Open weight
5LFM2.5-VL-3BLiquidAI · Open weight
olm Ocr

1 models

1Interfaze BetaInterfaze85.7%
vox Populi Wer

1 models

1Interfaze BetaInterfaze2.4%
design Arena Website

93 models

1Muse Spark 1.3Meta1364
2Kimi K3Moonshot AI1350
3Claude Fable 5.1Anthropic1320
4Claude Opus 5Anthropic · Closed
5Muse Spark 1.2Meta · Closed
+88 more
office Qa Pro

12 models

1Claude Opus 5.5Anthropic67.7%
2Claude Opus 5Anthropic66.9%
3Claude Opus 4.8Anthropic66.2%
4Hy4 previewTencent · Open weight
5Kimi K3Moonshot AI · Closed
+7 more
mmmu Pro Python

9 models

1GPT-5.6 SolOpenAI84.6%
2Kimi K3Moonshot AI83.4%
3GPT-5.5OpenAI83.2%
4GPT-5.4OpenAI · Closed
5GPT-5.6 TerraOpenAI · Closed
+4 more
omni Doc Bench15

6 models

1Qwen3.8 MaxAlibaba92.1%
2MiniMax M3MiniMax91.6%
3Qwen3.7 PlusAlibaba91.4%
4Qwen3.8-27BAlibaba · Open weight
5Qwen3.6-35B-A3BAlibaba · Open weight
+1 more
real World Qa

12 models

1Qwen3.8-Flash-NextAlibaba88.5%
2Qwen3.8 MaxAlibaba88.0%
3Qwen3.8-Omni-FlashAlibaba87.7%
4Qwen3.7 PlusAlibaba · Closed
5Qwen3.8-27BAlibaba · Open weight
+7 more
video Mme With Sub

6 models

1Qwen3.8 MaxAlibaba90.4%
2Qwen3.7 PlusAlibaba88.0%
3Qwen3.6-27BAlibaba87.7%
4MiMo-V2.5Xiaomi · Closed
5Qwen3.6-35B-A3BAlibaba · Open weight
+1 more
video Mme No Sub

2 models

1Qwen3.6-35B-A3BAlibaba82.5%
2Nemotron 3 Nano Omni 30B A3BNVIDIA72.2%
video Mme

3 models

1Seed 2.1 ProByteDance89.2%
2Seed 2.1 TurboByteDance89.0%
3Kimi K2.5Moonshot AI87.4%
math Vision

19 models

1Qwen3.8 MaxAlibaba95.2%
2Kimi K3Moonshot AI94.3%
3Seed 2.1 ProByteDance92.6%
4Qwen3.8-Omni-FlashAlibaba · Closed
5Qwen3.8-Flash-NextAlibaba · Open weight
+14 more
we Math

0 models

dyna Math

1 models

1Qwen3.6-27BAlibaba85.6%
m Star

1 models

1Qwen3.6-27BAlibaba81.4%
chat Cvqa

0 models

mm Long Bench Doc

1 models

1Nemotron 3 Nano Omni 30B A3BNVIDIA57.5%
cc Ocr

3 models

1Qwen3.6-35B-A3BAlibaba81.9%
2Qwen3.6-27BAlibaba81.2%
3Qwen3.8 MaxAlibaba79.6%
ai2d Test

3 models

1Qwen3.6-35B-A3BAlibaba92.7%
2Nemotron 3 Nano Omni 30B A3BNVIDIA88.5%
3ZAYA1-VL-8BZyphra87.5%
count Bench

4 models

1Qwen3.6-27BAlibaba97.8%
2ZAYA1-VL-8BZyphra88.1%
3LFM2.5-VL-3BLiquidAI87.3%
4LFM2.5-VL-450MLiquidAI · Open weight
refcoco Avg

6 models

1Qwen3.6-27BAlibaba92.5%
2Qwen3.6-35B-A3BAlibaba92.0%
3Nemotron 3 Nano Omni 30B A3BNVIDIA90.5%
4LFM2.5-VL-3BLiquidAI · Open weight
5ZAYA1-VL-8BZyphra · Open weight
+1 more
odinw13

2 models

1Qwen3.7 PlusAlibaba51.1%
2Qwen3.6-35B-A3BAlibaba50.8%
erqa

13 models

1Qwen3.8 MaxAlibaba77.8%
2Qwen3.8-Flash-NextAlibaba72.3%
3Seed 2.1 ProByteDance72.0%
4Seed 2.1 TurboByteDance · Closed
5Qwen3.8-Omni-FlashAlibaba · Closed
+8 more
video Mmmu

11 models

1Qwen3.8 MaxAlibaba88.7%
2Gemini 3 ProGoogle87.6%
3dots3-note PreviewDots Studio86.8%
4Kimi K2.5Moonshot AI · Open weight
5Qwen3.7 PlusAlibaba · Closed
+6 more
mlvu Avg

4 models

1Qwen3.8 MaxAlibaba90.8%
2Qwen3.7 PlusAlibaba87.4%
3Qwen3.6-27BAlibaba86.6%
4Qwen3.6-35B-A3BAlibaba · Open weight
mmvu

7 models

1Qwen3.8 MaxAlibaba82.4%
2GLM-5.3-FlashZ.AI80.5%
3Kimi K2.5Moonshot AI80.4%
4dots3-note PreviewDots Studio · Open weight
5Qwen3.5-122B-A10BAlibaba · Open weight
+2 more
screen Spot Pro

18 models

1GPT-6 AstraOpenAI92.7%
2Claude Opus 4.8Anthropic87.9%
3GPT-5.4OpenAI85.4%
4Qwen3.8 MaxAlibaba · Open weight
5Gemini 3.1 ProGoogle · Closed
+13 more
tir Bench

0 models

med Xpert Qa Mm

8 models

1Gemini 3.1 ProGoogle81.3%
2Qwen3.8 MaxAlibaba80.4%
3Muse SparkMeta78.4%
4GPT-5.4OpenAI · Closed
5Qwen3.7 PlusAlibaba · Closed
+3 more
zero Bench

8 models

1GPT-5.4OpenAI41.0%
2Muse SparkMeta33.0%
3Gemini 3.1 ProGoogle29.0%
4Qwen3.8 MaxAlibaba · Open weight
5Kimi K3Moonshot AI · Closed
+3 more
design2 Code

0 models

vision2 Web

4 models

1Qwen3.8 MaxAlibaba69.0%
2Qwen3.8-Flash-NextAlibaba64.0%
3Qwen3.8-27BAlibaba62.9%
4Qwen3.8-Omni-FlashAlibaba · Closed
image Mining

0 models

mm Search

0 models

mm Search Plus

1 models

1Qwen3.7 PlusAlibaba41.4%
simple Vqa

11 models

1Qwen3.7 PlusAlibaba81.7%
2Step 3.7 FlashStepFun79.2%
3Qwen3.8 MaxAlibaba75.0%
4dots3-note PreviewDots Studio · Open weight
5Gemini 3.1 ProGoogle · Closed
+6 more
facts Vlm

0 models

v Star

11 models

1Kimi K2.6Moonshot AI96.9%
2Qwen3.6 PlusAlibaba96.9%
3Qwen3.5 397BAlibaba95.8%
4Step 3.7 FlashStepFun · Open weight
5Qwen3.6-27BAlibaba · Open weight
+6 more
charxiv

39 models

1Qwen3.8 MaxAlibaba93.5%
2Claude Mythos 5Anthropic93.5%
3Qwen3.8-Omni-FlashAlibaba91.4%
4Kimi K3Moonshot AI · Closed
5Claude Opus 4.7 (Adaptive)Anthropic · Closed
+34 more
charxiv No Tools

14 models

1Claude Mythos 5Anthropic88.9%
2Qwen3.8 MaxAlibaba88.4%
3Gemini 3.8 FlashGoogle86.2%
4Kimi K3Moonshot AI · Closed
5Qwen3.8-Flash-NextAlibaba · Open weight
+9 more
blueprint Bench2

26 models

1GPT-6 AstraOpenAI49.7%
2Claude Fable 5.1Anthropic41.9%
3Claude Fable 5Anthropic38.6%
4Gemini 3.8 FlashGoogle · Closed
5GPT-5.5OpenAI · Closed
+21 more