BenchLM Benchmarks
219 benchmarks · 1095 model scores · Data from Sep 23, 2026
Agentic40 benchmarks
terminal Bench2
46 models
1GPT-5.6 SolOpenAI91.9%
2Claude Mythos 5Anthropic88.0%
3GPT-5.6 TerraOpenAI87.4%
4GPT-5.6 LunaOpenAI · Closed
5Claude Fable 5Anthropic · Closed
+41 morebrowse Comp
44 models
1Atria Dawn PreviewShanghai Artificial Intelligence Laboratory92.5%
2GPT-5.6 SolOpenAI92.2%
3GPT-6 AstraOpenAI91.5%
4Kimi K3Moonshot AI · Closed
5Claude Opus 5Anthropic · Closed
+39 morehle With Tools
20 models
1Claude Opus 5.5Anthropic67.7%
2Claude Opus 5Anthropic64.7%
3DeepSeek V4.1 FlashDeepSeek63.9%
4GLM-5.3Z.AI · Open weight
5DeepSeek V4 Pro 0813DeepSeek · Closed
+15 moregdpval Aa
113 models
1Claude Opus 5Anthropic1862
2Claude Opus 5.5Anthropic1846
3GLM-5.3-FlashZ.AI1773
4GLM-5.3Z.AI · Open weight
5Muse Spark 1.3Meta · Closed
+108 moregdpval Aa Normalized
116 models
1Claude Opus 5.5Anthropic67.3%
2Claude Fable 5.1Anthropic61.7%
3Claude Opus 5Anthropic60.4%
4Grok 4.7xAI · Closed
5MiMo-V2.6-ProXiaomi · Open weight
+111 moreaa Agentic Index
81 models
1Claude Fable 5.1Anthropic58.0%
2Claude Opus 5Anthropic56.2%
3Muse Spark 1.3Meta55.7%
4GLM-5.3Z.AI · Open weight
5Grok 4.6xAI · Closed
+76 moreapex Agents Aa
27 models
1Gemini 3.5 FlashGoogle47.1%
2Kimi K3Moonshot AI41.3%
3GPT-5.6 TerraOpenAI38.9%
4GPT-5.5OpenAI · Closed
5GPT-5.6 LunaOpenAI · Closed
+22 moregert Labs
54 models
1Claude Opus 4.8Anthropic72.97%
2GPT-5.5OpenAI72.93%
3Claude Opus 4.7Anthropic65.59%
4GPT-5.4OpenAI · Closed
5Qwen3.7 MaxAlibaba · Closed
+49 moreos World Verified
34 models
1Qwen3.8 MaxAlibaba86.1%
2Claude Fable 5Anthropic85%
3Claude Mythos 5Anthropic85%
4Qwen3.8-27BAlibaba · Open weight
5Claude Opus 4.8Anthropic · Closed
+29 morecyber Gym
26 models
1MiMo-V2.6-FlashXiaomi95.1%
2MiMo-V2.6-ProXiaomi94.0%
3DeepSeek V4.1 FlashDeepSeek88.1%
4Fugu CyberSakana AI · Closed
6Gemini 3.8 Flash CyberGoogle · Closed
+21 morebrowse Comp Vl
0 models
android World
9 models
1Qwen3.8-Omni-FlashAlibaba87.1%
2Qwen3.8 MaxAlibaba85.3%
3Qwen3.8-Flash-NextAlibaba84.5%
4Qwen3.8-27BAlibaba · Open weight
5Qwen3.7 PlusAlibaba · Closed
+4 moremcp Atlas
38 models
1Muse Spark 1.1Meta88.1%
2Claude Opus 5Anthropic85.8%
3Step 5 PreviewStepFun85.6%
4Kimi K3Moonshot AI · Closed
5Hy4 previewTencent · Open weight
+33 moretoolathlon
22 models
1Muse Spark 1.1Meta75.6%
2Claude Opus 4.8Anthropic59.9%
3GPT-5.6 SolOpenAI58%
4Gemini 3.5 FlashGoogle · Closed
5GPT-5.5OpenAI · Closed
+17 morez Claw Bench
0 models
tau2 Bench
148 models
2GPT-5.4OpenAIτ²-bench Telecom
4Claude Fable 5Anthropic · Closed98.5%
5GLM-5-TurboZ.AI · Closed98.5%
6GLM-5V-TurboZ.AI · Closed98.5%
7Step 3.7 FlashStepFun · Open weight98.5%
+143 moredeep Search Qa
19 models
1Atria Dawn PreviewShanghai Artificial Intelligence Laboratory96.0%
2Claude Opus 5Anthropic95.0%
3Kimi K3Moonshot AI95.0%
4Claude Opus 4.8Anthropic · Closed
5Step 3.7 FlashStepFun · Open weight
+14 moretau2 Airline
0 models
pinch Bench
44 models
1Anthropic93.5%
2Qwen3.7 MaxAlibaba92.5%
3Claude Opus 4.8Anthropic90.5%
5MiMo-V2.5Xiaomi · Closed
6Grok Build 0.1xAI · Closed
+39 moreopen Hands Index
33 models
1Claude Fable 5Anthropic81.0%
2Claude Opus 4.8Anthropic71.9%
3Claude Opus 4.7 (Adaptive)Anthropic69.7%
4Claude Opus 4.6Anthropic · Closed
5GPT-5.5OpenAI · Closed
+28 moreinference Bench
28 models
4Claude Fable 5Anthropic · Closed8.74x
5Claude Opus 4.7Anthropic · Closed8.53x
6GPT-6 AstraOpenAI · Closed7.90x
7Claude Opus 4.8Anthropic · Closed7.60x
9GPT-5.6 SolOpenAI · Closed7.34x
+23 morebfcl V4
22 models
1BTL-3Bad Theory Labs88.5%
2Atria Dawn PreviewShanghai Artificial Intelligence Laboratory77.0%
3Qwen3.7 MaxAlibaba75.0%
4BTL-4Bad Theory Labs · Open weight
5Ling 3.0 FlashInclusionAI · Open weight
+17 moremle Bench Lite
3 models
1Atria Dawn PreviewShanghai Artificial Intelligence Laboratory86.2%
2MiniMax M2.7MiniMax66.6%
3Agents-A1-4BInternScience22.7%
claw Eval
26 models
1Claude Opus 4.6Anthropic70.4%
2Step 3.7 FlashStepFun68.3%
3Claude Sonnet 4.6Anthropic67.8%
4MiMo-V2.5-ProXiaomi · Closed
5Muse SparkMeta · Closed
+21 moreqwen Claw Bench
10 models
1Qwen3.7 MaxAlibaba64.3%
2Qwen3.7 PlusAlibaba61.8%
3Qwen 3.6 Max (preview)Alibaba59.0%
4Qwen3.6 PlusAlibaba · Closed
5Kimi K2.5Moonshot AI · Open weight
+5 moreqwen Web Bench
5 models
1Qwen3.7 MaxAlibaba1568
2Qwen3.7 PlusAlibaba1536
3Qwen 3.6 Max (preview)Alibaba1532
4Qwen3.6-27BAlibaba · Open weight
5Qwen3.6-35B-A3BAlibaba · Open weight
tau3 Bench
17 models
1Mercury 2.5Inceptionτ³-bench Telecom
2Mistral Medium 3.5 128BMistralτ³-bench Telecom
4Nemotron 3 UltraNVIDIA · Open weight70.9%
5Qwen3.6 PlusAlibaba · Closed70.7%
6GLM-5.1Z.AI · Open weight70.6%
+12 morevita Bench
12 models
1Qwen3.7 MaxAlibaba47.9%
2Qwen3.7 PlusAlibaba45.6%
3Qwen3.6 PlusAlibaba44.3%
4Qwen3.5 397BAlibaba · Open weight
5Agents-A1-4BInternScience · Open weight
+7 moredeep Planning
7 models
1Qwen3.7 PlusAlibaba62.3%
2Qwen3.6 PlusAlibaba41.5%
3Qwen3.5 397BAlibaba37.6%
4Claude Opus 4.5Anthropic · Closed
5Qwen3.6-35B-A3BAlibaba · Open weight
+2 moremcp Tasks
5 models
1Qwen3.5 397BAlibaba74.2%
2Qwen3.6 PlusAlibaba74.1%
3Claude Opus 4.5Anthropic71.8%
4GLM-5Z.AI · Open weight
5Kimi K2.5Moonshot AI · Open weight
wide Research
15 models
1Mercury 2Inception92.3%
2Hy4 previewTencent83.9%
3Qwen3.8 MaxAlibaba81.9%
5Kimi K2.6Moonshot AI · Open weight
6Ornith-1.5-397BOrnith AI · Open weight
+10 moretau Bench
0 models
web Arena
0 models
finance Agent V2
62 models
1Gemini 3.8 FlashGooglehigh reasoning
2Muse Spark 1.2Metaxhigh reasoning
3Metamax reasoning60.0%
4Gemini 3.7 FlashGoogle · Closed59.0%
5Muse Spark 1.3Meta · Closed58.9%
+57 more