BenchLM Benchmarks
219 benchmarks · 146 model scores · Data from Sep 23, 2026
Math23 benchmarks
aime2023
0 models
aime2025
18 models
1MAI-Thinking-1Microsoft97%
2Kimi K2.5Moonshot AI96.1%
3Kimi K2.5 (Reasoning)Moonshot AI96.1%
4GLM-4.7Z.AI · Open weight
5Ternary Bonsai 2 27BPrism ML · Open weight
+13 moregsm8k
3 models
1Ternary Bonsai 2 27BPrism ML96.7%
2Celeris-1Celeris93.7%
5Soofi S 30B-A3BSoofi Project · Open weight
math Benchmark
0 models
cmath
0 models
aime2025 Arcee
6 models
1Claude Opus 4.6Anthropic99.8%
2Kimi K2.5Moonshot AI96.3%
3Trinity-Large-ThinkingArcee AI96.3%
4GLM-5Z.AI · Open weight
5MiniMax M2.7MiniMax · Open weight
+1 morehmmt2023
0 models
hmmt2024
0 models
hmmt2025
0 models
brumo2025
0 models
math500
7 models
1Ternary Bonsai 2 27BPrism ML98.8%
2LongCat-Flash-Lite-SparseMeituan95.8%
3MiniCPM5-2BOpenBMB94.6%
4MiniCPM5-1BOpenBMB · Open weight
5LFM2.5-8B-A1BLiquidAI · Open weight
+2 moreaime2026
28 models
1GLM-5.2Z.AI99.2%
2InklingThinking Machines Lab97.1%
3A.X K2SK Telecom97.1%
4Kimi K2.6Moonshot AI · Open weight
5Ternary Bonsai 2 27BPrism ML · Open weight
+23 morehmmt Feb2025
10 models
1GLM-5Z.AI97.5%
2Qwen3.6 PlusAlibaba96.7%
3Kimi K2.5Moonshot AI95.4%
4Qwen3.5 397BAlibaba · Open weight
5Qwen3.6-27BAlibaba · Open weight
+5 morehmmt Nov2025
9 models
1GLM-5Z.AI96.9%
2Qwen3.6 PlusAlibaba94.6%
3GLM-5.2Z.AI94.4%
4GLM-5.1Z.AI · Open weight
5Claude Opus 4.5Anthropic · Closed
+4 morehmmt Feb2026
23 models
1Qwen3.7 MaxAlibaba97.1%
2DeepSeek V4 Pro 0813DeepSeek95.2%
3DeepSeek V4 Flash 0731DeepSeek94.8%
5Solar Open 2Upstage · Open weight
6Qwen3.7 PlusAlibaba · Closed
+18 moreimo Answer Bench
9 models
1dots3-note PreviewDots Studio90.9%
2Qwen3.7 MaxAlibaba90.0%
3DeepSeek V4 Pro 0813DeepSeek89.8%
4DeepSeek V4 Flash 0731DeepSeek · Closed
6Qwen3.7 PlusAlibaba · Closed
+4 moreapex
8 models
1Hy4 previewTencent74.2%
2DeepSeek V4.1 FlashDeepSeek65.6%
3A.X K2SK Telecom45.8%
4Qwen3.7 MaxAlibaba · Closed
5DeepSeek V4 Pro 0813DeepSeek · Closed
+3 moreapex Shortlist
3 models
1DeepSeek V4 Pro 0813DeepSeek90.2%
2A.X K2SK Telecom88.6%
3DeepSeek V4 Flash 0731DeepSeek85.7%
mm Answer Bench
10 models
1GLM-5.2Z.AI91.0%
2Kimi K2.6Moonshot AI86.0%
3Claude Opus 4.5Anthropic84.0%
4GLM-5.1Z.AI · Open weight
5Qwen3.6 PlusAlibaba · Closed
+5 morefrontier Math
7 models
1GPT-5.6 SolOpenAI89%
2GPT-5.6 TerraOpenAI84.9%
3GPT-5.6 LunaOpenAI78.6%
4GPT-5.5 ProOpenAI · Closed
5GPT-5.5OpenAI · Closed
+2 moreusamo2026
3 models
1Claude Mythos 5Anthropic97.6%
2Claude Opus 4.8Anthropic96.7%
3MiniMax M3MiniMax85.7%