context.vn
Menu

BenchLM Benchmarks

219 benchmarks · 146 model scores · Data from Sep 23, 2026

Math23 benchmarks

aime2023

0 models

aime2024

1 models

1o3-miniOpenAI87.3%
aime2025

18 models

1MAI-Thinking-1Microsoft97%
2Kimi K2.5Moonshot AI96.1%
3Kimi K2.5 (Reasoning)Moonshot AI96.1%
4GLM-4.7Z.AI · Open weight
5Ternary Bonsai 2 27BPrism ML · Open weight
+13 more
gsm8k

3 models

1Ternary Bonsai 2 27BPrism ML96.7%
2Celeris-1Celeris93.7%
5Soofi S 30B-A3BSoofi Project · Open weight
cmath

0 models

aime2025 Arcee

6 models

1Claude Opus 4.6Anthropic99.8%
2Kimi K2.5Moonshot AI96.3%
3Trinity-Large-ThinkingArcee AI96.3%
4GLM-5Z.AI · Open weight
5MiniMax M2.7MiniMax · Open weight
+1 more
hmmt2023

0 models

hmmt2024

0 models

hmmt2025

0 models

brumo2025

0 models

math500

7 models

1Ternary Bonsai 2 27BPrism ML98.8%
2LongCat-Flash-Lite-SparseMeituan95.8%
3MiniCPM5-2BOpenBMB94.6%
4MiniCPM5-1BOpenBMB · Open weight
5LFM2.5-8B-A1BLiquidAI · Open weight
+2 more
aime2026

28 models

1GLM-5.2Z.AI99.2%
2InklingThinking Machines Lab97.1%
3A.X K2SK Telecom97.1%
4Kimi K2.6Moonshot AI · Open weight
5Ternary Bonsai 2 27BPrism ML · Open weight
+23 more
ipho2025 Theory

1 models

1GPT-5.4 ProOpenAI93.5%
hmmt Feb2025

10 models

1GLM-5Z.AI97.5%
2Qwen3.6 PlusAlibaba96.7%
3Kimi K2.5Moonshot AI95.4%
4Qwen3.5 397BAlibaba · Open weight
5Qwen3.6-27BAlibaba · Open weight
+5 more
hmmt Nov2025

9 models

1GLM-5Z.AI96.9%
2Qwen3.6 PlusAlibaba94.6%
3GLM-5.2Z.AI94.4%
4GLM-5.1Z.AI · Open weight
5Claude Opus 4.5Anthropic · Closed
+4 more
hmmt Feb2026

23 models

1Qwen3.7 MaxAlibaba97.1%
2DeepSeek V4 Pro 0813DeepSeek95.2%
3DeepSeek V4 Flash 0731DeepSeek94.8%
5Solar Open 2Upstage · Open weight
6Qwen3.7 PlusAlibaba · Closed
+18 more
imo Answer Bench

9 models

1dots3-note PreviewDots Studio90.9%
2Qwen3.7 MaxAlibaba90.0%
3DeepSeek V4 Pro 0813DeepSeek89.8%
4DeepSeek V4 Flash 0731DeepSeek · Closed
6Qwen3.7 PlusAlibaba · Closed
+4 more
apex

8 models

1Hy4 previewTencent74.2%
2DeepSeek V4.1 FlashDeepSeek65.6%
3A.X K2SK Telecom45.8%
4Qwen3.7 MaxAlibaba · Closed
5DeepSeek V4 Pro 0813DeepSeek · Closed
+3 more
apex Shortlist

3 models

1DeepSeek V4 Pro 0813DeepSeek90.2%
2A.X K2SK Telecom88.6%
3DeepSeek V4 Flash 0731DeepSeek85.7%
mm Answer Bench

10 models

1GLM-5.2Z.AI91.0%
2Kimi K2.6Moonshot AI86.0%
3Claude Opus 4.5Anthropic84.0%
4GLM-5.1Z.AI · Open weight
5Qwen3.6 PlusAlibaba · Closed
+5 more
frontier Math

7 models

1GPT-5.6 SolOpenAI89%
2GPT-5.6 TerraOpenAI84.9%
3GPT-5.6 LunaOpenAI78.6%
4GPT-5.5 ProOpenAI · Closed
5GPT-5.5OpenAI · Closed
+2 more
usamo2026

3 models

1Claude Mythos 5Anthropic97.6%
2Claude Opus 4.8Anthropic96.7%
3MiniMax M3MiniMax85.7%