context.vn
Menu

BenchLM Benchmarks

219 benchmarks · 1514 model scores · Data from Sep 23, 2026

Knowledge37 benchmarks

mmlu

7 models

1o1OpenAI91.8%
2GPT-4.1OpenAI90.2%
5GPT-4.1 miniOpenAI · Closed
6Trinity-Large-PreviewArcee AI · Open weight
7o3-miniOpenAI · Closed
+2 more
gpqa

86 models

1GPT-6 AstraOpenAI96%
2Sakana Fugu-UltraSakana AI95.5%
3Sakana FuguSakana AI95.5%
4GPT-5.6 SolOpenAI · Closed
5Claude Opus 4.7 (Adaptive)Anthropic · Closed
+81 more
super Gpqa

20 models

1Claude Opus 4.6Anthropic95%
2Claude Sonnet 4.6Anthropic95%
3Qwen 3.6 Max (preview)Alibaba73.9%
4Qwen3.7 MaxAlibaba · Closed
5Qwen3.6 PlusAlibaba · Closed
+15 more
mmlu Pro

46 models

1Qwen3.7 MaxAlibaba89.6%
2Claude Opus 4.5Anthropic89.5%
3Qwen3.7 PlusAlibaba88.5%
4Qwen3.6 PlusAlibaba · Closed
5Qwen3.5 397BAlibaba · Open weight
+41 more
agieval

1 models

3Soofi S 30B-A3BSoofi Project66.9%
hle

59 models

1Claude Fable 5.1Anthropic65%
2Claude Opus 5Anthropic64.7%
3Claude Mythos 5Anthropic64.5%
4Muse Spark 1.1Meta · Closed
5GPT-5.4 ProOpenAI · Closed
+54 more
frontier Science

1 models

1GPT-5.4 ProOpenAI36.7%
artificial Analysis

208 models

1GPT-5.6 SolOpenAI58.9%
2Claude Opus 5.5Anthropic57.6%
3GPT-5.6 TerraOpenAI55.0%
4Claude Fable 5.1Anthropic · Closed
5DeepSeek V4 Pro 0813DeepSeek · Closed
+203 more
aa Gpqa Diamond

198 models

1GPT-6 AstraOpenAI96.1%
2Gemini 3.8 FlashGoogle95.3%
3Grok 4.6xAI94.9%
4Gemini 3.7 FlashGoogle · Closed
5GPT-5.6 SolOpenAI · Closed
+193 more
aa Hle

203 models

1Claude Opus 5.5Anthropic61.4%
2Claude Fable 5.1Anthropic59.1%
3Claude Fable 5Anthropic55.5%
4Claude Opus 5Anthropic · Closed
5GPT-6 AstraOpenAI · Closed
+198 more
aa Omniscience Index

193 models

1Claude Opus 5.5Anthropic46.4%
2Claude Fable 5.1Anthropic43.5%
3GPT-6 AstraOpenAI43.4%
4Claude Fable 5Anthropic · Closed
5Claude Opus 5Anthropic · Closed
+188 more
omniscience Accuracy

194 models

1Claude Fable 5.1Anthropic67.2%
2Claude Opus 5.5Anthropic66.2%
3Claude Fable 5Anthropic65.4%
4GPT-6 AstraOpenAI · Closed
5Claude Opus 5Anthropic · Closed
+189 more
omniscience Hallucination Rate

194 models

1Command A+Cohere14.2%
2LFM2.5-2.6BLiquidAI16.0%
3MiniMax M3MiniMax18.4%
4Quasar 438BMultiverse Computing · Closed
5MiniCPM5-2BOpenBMB · Open weight
+189 more
simple Qa

3 models

1DeepSeek V4 Pro 0813DeepSeek57.9%
5DeepSeek V4 Flash 0731DeepSeek · Closed
6MAI-Thinking-1Microsoft · Closed
chinese Simple Qa

2 models

1DeepSeek V4 Pro 0813DeepSeek84.4%
2DeepSeek V4 Flash 0731DeepSeek78.9%
open Book Qa

0 models

health Bench Hard

11 models

1Muse SparkMeta42.8%
2GPT-5.4OpenAI40.1%
3GPT-6 AstraOpenAI36.6%
4GPT-5.6 SolOpenAI · Closed
5GPT-5.6 TerraOpenAI · Closed
+6 more
med Xpert Qa Text

5 models

1Gemini 3.1 ProGoogle71.5%
2GPT-5.4OpenAI59.6%
3Muse SparkMeta52.6%
4Claude Opus 4.6Anthropic · Closed
5Grok 4.20xAI · Closed
frontier Science Research

4 models

1Apodex 1.1Apodex63.3%
2Apodex 1.1 MiniApodex51.7%
3GPT-5.4 ProOpenAI36.7%
4Agents-A1-4BInternScience · Open weight
truthfulqa

0 models

hle No Tools

39 models

1Claude Opus 5.5Anthropic64.4%
2Claude Fable 5.1Anthropic60.9%
3Claude Mythos 5Anthropic59%
4Claude Opus 5Anthropic · Closed
5Muse Spark 1.1Meta · Closed
+34 more
mmlu Pro Arcee

6 models

1Claude Opus 4.6Anthropic89.1%
2Kimi K2.5Moonshot AI87.1%
3GLM-5Z.AI85.8%
4Trinity-Large-ThinkingArcee AI · Open weight
5MiniMax M2.7MiniMax · Open weight
+1 more
mmlu Redux

11 models

1Claude Opus 4.5Anthropic96.6%
2Qwen3.7 MaxAlibaba95%
3Qwen3.5 397BAlibaba94.9%
4Qwen3.7 PlusAlibaba · Closed
5Qwen3.6 PlusAlibaba · Closed
+6 more
mmmlu

5 models

1Interfaze BetaInterfaze90.9%
2Qwen3.7 MaxAlibaba90.3%
4Qwen3.7 PlusAlibaba · Closed
6K-EXAONE 2.0LG AI Research · Open weight
7Gemma 4 12BGoogle · Open weight
c Eval

6 models

1Qwen3.6 PlusAlibaba93.3%
3Qwen3.5 397BAlibaba93%
4Claude Opus 4.5Anthropic · Closed
6Qwen3.6-27BAlibaba · Open weight
7Qwen3.6-35B-A3BAlibaba · Open weight
+1 more
cmmlu

1 models

3LongCat-Flash-Lite-SparseMeituan84.3%
multi Lo Ko

0 models

trivia Qa

0 models

kmmlu

2 models

1Kanana-2 3B InstructKakao43.3%
2Kanana-2 1.3B InstructKakao42.8%
kmmlu Hard

0 models

kmmlu Redux

0 models

kmmlu Pro

4 models

1A.X K2SK Telecom80.5%
2Solar Pro 4Upstage79.2%
3Solar Open 2Upstage78.4%
4K-EXAONE 2.0LG AI Research · Open weight
click

3 models

1A.X K2SK Telecom91.6%
2Solar Open 2Upstage90.7%
3K-EXAONE 2.0LG AI Research84.2%
kobalt

1 models

1A.X K2SK Telecom73%
korean Csat

0 models

hrm8k

1 models

1Solar Open 2Upstage92.2%