BenchLM Benchmarks
219 benchmarks · 1514 model scores · Data from Sep 23, 2026
Knowledge37 benchmarks
mmlu
7 models
1o1OpenAI91.8%
2GPT-4.1OpenAI90.2%
5GPT-4.1 miniOpenAI · Closed
6Trinity-Large-PreviewArcee AI · Open weight
7o3-miniOpenAI · Closed
+2 moregpqa
86 models
1GPT-6 AstraOpenAI96%
2Sakana Fugu-UltraSakana AI95.5%
3Sakana FuguSakana AI95.5%
4GPT-5.6 SolOpenAI · Closed
5Claude Opus 4.7 (Adaptive)Anthropic · Closed
+81 moresuper Gpqa
20 models
1Claude Opus 4.6Anthropic95%
2Claude Sonnet 4.6Anthropic95%
3Qwen 3.6 Max (preview)Alibaba73.9%
4Qwen3.7 MaxAlibaba · Closed
5Qwen3.6 PlusAlibaba · Closed
+15 moremmlu Pro
46 models
1Qwen3.7 MaxAlibaba89.6%
2Claude Opus 4.5Anthropic89.5%
3Qwen3.7 PlusAlibaba88.5%
4Qwen3.6 PlusAlibaba · Closed
5Qwen3.5 397BAlibaba · Open weight
+41 morehle
59 models
1Claude Fable 5.1Anthropic65%
2Claude Opus 5Anthropic64.7%
3Claude Mythos 5Anthropic64.5%
4Muse Spark 1.1Meta · Closed
5GPT-5.4 ProOpenAI · Closed
+54 moreartificial Analysis
208 models
1GPT-5.6 SolOpenAI58.9%
2Claude Opus 5.5Anthropic57.6%
3GPT-5.6 TerraOpenAI55.0%
4Claude Fable 5.1Anthropic · Closed
5DeepSeek V4 Pro 0813DeepSeek · Closed
+203 moreaa Gpqa Diamond
198 models
1GPT-6 AstraOpenAI96.1%
2Gemini 3.8 FlashGoogle95.3%
3Grok 4.6xAI94.9%
4Gemini 3.7 FlashGoogle · Closed
5GPT-5.6 SolOpenAI · Closed
+193 moreaa Hle
203 models
1Claude Opus 5.5Anthropic61.4%
2Claude Fable 5.1Anthropic59.1%
3Claude Fable 5Anthropic55.5%
4Claude Opus 5Anthropic · Closed
5GPT-6 AstraOpenAI · Closed
+198 moreaa Omniscience Index
193 models
1Claude Opus 5.5Anthropic46.4%
2Claude Fable 5.1Anthropic43.5%
3GPT-6 AstraOpenAI43.4%
4Claude Fable 5Anthropic · Closed
5Claude Opus 5Anthropic · Closed
+188 moreomniscience Accuracy
194 models
1Claude Fable 5.1Anthropic67.2%
2Claude Opus 5.5Anthropic66.2%
3Claude Fable 5Anthropic65.4%
4GPT-6 AstraOpenAI · Closed
5Claude Opus 5Anthropic · Closed
+189 moreomniscience Hallucination Rate
194 models
1Command A+Cohere14.2%
2LFM2.5-2.6BLiquidAI16.0%
3MiniMax M3MiniMax18.4%
4Quasar 438BMultiverse Computing · Closed
5MiniCPM5-2BOpenBMB · Open weight
+189 moresimple Qa
3 models
1DeepSeek V4 Pro 0813DeepSeek57.9%
5DeepSeek V4 Flash 0731DeepSeek · Closed
6MAI-Thinking-1Microsoft · Closed
open Book Qa
0 models
health Bench Hard
11 models
1Muse SparkMeta42.8%
2GPT-5.4OpenAI40.1%
3GPT-6 AstraOpenAI36.6%
4GPT-5.6 SolOpenAI · Closed
5GPT-5.6 TerraOpenAI · Closed
+6 moremed Xpert Qa Text
5 models
1Gemini 3.1 ProGoogle71.5%
2GPT-5.4OpenAI59.6%
3Muse SparkMeta52.6%
4Claude Opus 4.6Anthropic · Closed
5Grok 4.20xAI · Closed
frontier Science Research
4 models
1Apodex 1.1Apodex63.3%
2Apodex 1.1 MiniApodex51.7%
3GPT-5.4 ProOpenAI36.7%
4Agents-A1-4BInternScience · Open weight
truthfulqa
0 models
hle No Tools
39 models
1Claude Opus 5.5Anthropic64.4%
2Claude Fable 5.1Anthropic60.9%
3Claude Mythos 5Anthropic59%
4Claude Opus 5Anthropic · Closed
5Muse Spark 1.1Meta · Closed
+34 moremmlu Pro Arcee
6 models
1Claude Opus 4.6Anthropic89.1%
2Kimi K2.5Moonshot AI87.1%
3GLM-5Z.AI85.8%
4Trinity-Large-ThinkingArcee AI · Open weight
5MiniMax M2.7MiniMax · Open weight
+1 moremmlu Redux
11 models
1Claude Opus 4.5Anthropic96.6%
2Qwen3.7 MaxAlibaba95%
3Qwen3.5 397BAlibaba94.9%
4Qwen3.7 PlusAlibaba · Closed
5Qwen3.6 PlusAlibaba · Closed
+6 moremmmlu
5 models
1Interfaze BetaInterfaze90.9%
2Qwen3.7 MaxAlibaba90.3%
4Qwen3.7 PlusAlibaba · Closed
6K-EXAONE 2.0LG AI Research · Open weight
7Gemma 4 12BGoogle · Open weight
c Eval
6 models
1Qwen3.6 PlusAlibaba93.3%
3Qwen3.5 397BAlibaba93%
4Claude Opus 4.5Anthropic · Closed
6Qwen3.6-27BAlibaba · Open weight
7Qwen3.6-35B-A3BAlibaba · Open weight
+1 moremulti Lo Ko
0 models
facts Parametric
0 models
trivia Qa
0 models
kmmlu Hard
0 models
kmmlu Redux
0 models
kmmlu Pro
4 models
1A.X K2SK Telecom80.5%
2Solar Pro 4Upstage79.2%
3Solar Open 2Upstage78.4%
4K-EXAONE 2.0LG AI Research · Open weight
korean Csat
0 models