context.vn
Menu

BenchLM Benchmarks

219 benchmarks · 28 model scores · Data from Sep 23, 2026

Multilingual7 benchmarks

mgsm

0 models

mmlu Pro X

12 models

1Qwen3.7 MaxAlibaba87%
2Claude Opus 4.5Anthropic85.7%
3Qwen3.7 PlusAlibaba85.4%
4Qwen3.6 PlusAlibaba · Closed
5Qwen3.5 397BAlibaba · Open weight
+7 more
nova63

7 models

1Qwen3.5 397BAlibaba59.1%
2Qwen3.7 MaxAlibaba59.0%
3Qwen3.7 PlusAlibaba58.8%
4Qwen3.6 PlusAlibaba · Closed
5Claude Opus 4.5Anthropic · Closed
+2 more
include

4 models

1Claude Opus 5Anthropic89.8%
2Claude Opus 4.8Anthropic87.6%
3Qwen3.7 MaxAlibaba86.2%
4Qwen3.7 PlusAlibaba · Closed
poly Math

3 models

1Qwen3.7 MaxAlibaba86.5%
2Qwen3.7 PlusAlibaba84.0%
3K-EXAONE 2.0LG AI Research71.3%
vwt2k Lite

0 models

maxife

2 models

1Qwen3.7 MaxAlibaba89.2%
2Qwen3.7 PlusAlibaba88.8%