context.vn
Menu

BenchLM Benchmarks

219 benchmarks · 1332 model scores · Data from Sep 23, 2026

External15 benchmarks

vals Index

59 models

1Claude Fable 5.1Anthropic68.83%
2Claude Opus 5Anthropic67.21%
3GPT-6 AstraOpenAImax reasoning
4Claude Opus 5.5Anthropic · Closed
5Claude Fable 5Anthropic · Closed
+54 more
vals Multimodal Index

33 models

1Claude Fable 5Anthropic74.15%
2Claude Opus 5Anthropic73.90%
3Kimi K3Moonshot AI73.42%
4GPT-5.6 SolOpenAI · Closed72.64%
5Claude Opus 4.8Anthropic · Closed
+28 more
vals Corp Fin V2

131 models

1Claude Opus 5Anthropic73.19%
2Claude Fable 5Anthropic71.83%
3Kimi K3Moonshot AI71.56%
4Muse Spark 1.1Meta · Closed71.29%
5Muse Spark 1.2Meta · Closed70.94%
+126 more
vals Med Code

94 models

1Claude Opus 5Anthropic63.57%
2Google59.06%
3Claude Fable 5Anthropic56.07%
4Gemini 3 Flash PreviewGoogle
5Gemini 3.5 FlashGoogle · Closed
+89 more
vals Med Scribe

96 models

1Claude Opus 5.5Anthropic91.43%
2Claude Fable 5.1Anthropic91.29%
3Claude Opus 5Anthropic90.98%
4Muse Spark 1.2Meta · Closed
5Grok 4.7xAI · Closed
+91 more
vals Mortgage Tax

97 models

1Claude Opus 5Anthropic72.06%
2Claude Fable 5.1Anthropic70.79%
3Claude Opus 4.7Anthropic70.27%
4Claude Sonnet 5Anthropic · Closed
5Claude Opus 4.8Anthropic · Closed
+92 more
vals Proof Bench

35 models

1Claude Opus 5.5Anthropic100.00%
2Claude Fable 5.1Anthropic100.00%
3logicalintelligence100.00%
4GPT-6 AstraOpenAI · Closed
5Claude Opus 5Anthropic · Closed
+30 more
vals Legal Bench

144 models

1Claude Fable 5Anthropic88.56%
2Claude Fable 5.1Anthropic88.51%
3Googlehigh reasoning87.40%
4Gemini 3.7 FlashGoogle · Closed87.26%
5Gemini 3 Pro PreviewGoogle87.03%
+139 more
vals Case Law V2

53 models

1Grok 4.3xAI79.31%
2GPT-5.1OpenAI73.42%
3GPT-4.1OpenAI69.88%
4GPT-5 miniOpenAI · Closed
5Claude Opus 4.7Anthropic · Closed
+48 more
deep Swe

25 models

4GPT-5.6 SolOpenAI · Closed72.7%
5Claude Fable 5Anthropic · Closed69.7%
6GPT-5.6 TerraOpenAI · Closed69.6%
7GLM-5.3Z.AI · Open weight69.0%
8Kimi K3Moonshot AI · Closed68.5%
+20 more
vals Swe Bench

87 models

1Claude Opus 5Anthropic97.0%
2DeepSeek V4 Pro 0813DeepSeekmax reasoning
3GPT-5.6 SolOpenAImax reasoning
4Grok 4.6xAI · Closed95.6%
5GPT-5.6 TerraOpenAI · Closed95.4%
+82 more
vals Terminal Bench2

66 models

1GPT-5.5OpenAIhigh reasoning
2Claude Opus 4.8Anthropic70.04%
3Claude Opus 4.7Anthropic68.54%
4Gemini 3.5 FlashGoogle · Closed67.42%
5Gemini 3.1 Pro PreviewGoogle67.42%
+61 more
vals Live Code Bench

142 models

1Claude Fable 5.1Anthropic90.5%
2Claude Fable 5Anthropic89.8%
3Gemini 3.8 FlashGooglehigh reasoning
4Claude Opus 5Anthropic · Closed
5Gemini 3.7 FlashGoogle · Closed88.7%
+137 more
vals Gpqa Diamond

135 models

1Googlehigh reasoning95.5%
2GPT-5.6 SolOpenAImax reasoning
3Grok 4.6xAIhigh reasoning
4Gemini 3.8 FlashGoogle · Closed94.4%
5Gemini 3.7 FlashGoogle · Closed93.9%
+130 more
vals Mmlu Pro

135 models

1Claude Fable 5.1Anthropic92.4%
2Claude Opus 5Anthropic91.6%
3Claude Fable 5Anthropic91.5%
4Gemini 3.1 Pro PreviewGoogle91.0%
5Gemini 3.8 FlashGoogle · Closed90.2%
+130 more