context.vn
Menu

BenchLM Benchmarks

219 benchmarks · 1095 model scores · Data from Sep 23, 2026

Agentic40 benchmarks

terminal Bench2

46 models

1GPT-5.6 SolOpenAI91.9%
2Claude Mythos 5Anthropic88.0%
3GPT-5.6 TerraOpenAI87.4%
4GPT-5.6 LunaOpenAI · Closed
5Claude Fable 5Anthropic · Closed
+41 more
browse Comp

44 models

1Atria Dawn PreviewShanghai Artificial Intelligence Laboratory92.5%
2GPT-5.6 SolOpenAI92.2%
3GPT-6 AstraOpenAI91.5%
4Kimi K3Moonshot AI · Closed
5Claude Opus 5Anthropic · Closed
+39 more
hle With Tools

20 models

1Claude Opus 5.5Anthropic67.7%
2Claude Opus 5Anthropic64.7%
3DeepSeek V4.1 FlashDeepSeek63.9%
4GLM-5.3Z.AI · Open weight
5DeepSeek V4 Pro 0813DeepSeek · Closed
+15 more
gdpval Aa

113 models

1Claude Opus 5Anthropic1862
2Claude Opus 5.5Anthropic1846
3GLM-5.3-FlashZ.AI1773
4GLM-5.3Z.AI · Open weight
5Muse Spark 1.3Meta · Closed
+108 more
gdpval Aa Normalized

116 models

1Claude Opus 5.5Anthropic67.3%
2Claude Fable 5.1Anthropic61.7%
3Claude Opus 5Anthropic60.4%
4Grok 4.7xAI · Closed
5MiMo-V2.6-ProXiaomi · Open weight
+111 more
aa Agentic Index

81 models

1Claude Fable 5.1Anthropic58.0%
2Claude Opus 5Anthropic56.2%
3Muse Spark 1.3Meta55.7%
4GLM-5.3Z.AI · Open weight
5Grok 4.6xAI · Closed
+76 more
apex Agents Aa

27 models

1Gemini 3.5 FlashGoogle47.1%
2Kimi K3Moonshot AI41.3%
3GPT-5.6 TerraOpenAI38.9%
4GPT-5.5OpenAI · Closed
5GPT-5.6 LunaOpenAI · Closed
+22 more
gert Labs

54 models

1Claude Opus 4.8Anthropic72.97%
2GPT-5.5OpenAI72.93%
3Claude Opus 4.7Anthropic65.59%
4GPT-5.4OpenAI · Closed
5Qwen3.7 MaxAlibaba · Closed
+49 more
os World Verified

34 models

1Qwen3.8 MaxAlibaba86.1%
2Claude Fable 5Anthropic85%
3Claude Mythos 5Anthropic85%
4Qwen3.8-27BAlibaba · Open weight
5Claude Opus 4.8Anthropic · Closed
+29 more
cyber Gym

26 models

1MiMo-V2.6-FlashXiaomi95.1%
2MiMo-V2.6-ProXiaomi94.0%
3DeepSeek V4.1 FlashDeepSeek88.1%
4Fugu CyberSakana AI · Closed
6Gemini 3.8 Flash CyberGoogle · Closed
+21 more
os World

2 models

1Claude Opus 4.5Anthropic66.3%
2Nemotron 3 Nano Omni 30B A3BNVIDIA47.4%
android World

9 models

1Qwen3.8-Omni-FlashAlibaba87.1%
2Qwen3.8 MaxAlibaba85.3%
3Qwen3.8-Flash-NextAlibaba84.5%
4Qwen3.8-27BAlibaba · Open weight
5Qwen3.7 PlusAlibaba · Closed
+4 more
web Voyager

2 models

1Fara1.5-27BMicrosoft89.3%
2Fara1.5-4BMicrosoft80.8%
mcp Atlas

38 models

1Muse Spark 1.1Meta88.1%
2Claude Opus 5Anthropic85.8%
3Step 5 PreviewStepFun85.6%
4Kimi K3Moonshot AI · Closed
5Hy4 previewTencent · Open weight
+33 more
toolathlon

22 models

1Muse Spark 1.1Meta75.6%
2Claude Opus 4.8Anthropic59.9%
3GPT-5.6 SolOpenAI58%
4Gemini 3.5 FlashGoogle · Closed
5GPT-5.5OpenAI · Closed
+17 more
z Claw Bench

0 models

tau2 Bench

148 models

2GPT-5.4OpenAIτ²-bench Telecom
4Claude Fable 5Anthropic · Closed98.5%
5GLM-5-TurboZ.AI · Closed98.5%
6GLM-5V-TurboZ.AI · Closed98.5%
7Step 3.7 FlashStepFun · Open weight98.5%
+143 more
deep Search Qa

19 models

1Atria Dawn PreviewShanghai Artificial Intelligence Laboratory96.0%
2Claude Opus 5Anthropic95.0%
3Kimi K3Moonshot AI95.0%
4Claude Opus 4.8Anthropic · Closed
5Step 3.7 FlashStepFun · Open weight
+14 more
tau2 Airline

0 models

pinch Bench

44 models

1Anthropic93.5%
2Qwen3.7 MaxAlibaba92.5%
3Claude Opus 4.8Anthropic90.5%
5MiMo-V2.5Xiaomi · Closed
6Grok Build 0.1xAI · Closed
+39 more
open Hands Index

33 models

1Claude Fable 5Anthropic81.0%
2Claude Opus 4.8Anthropic71.9%
3Claude Opus 4.7 (Adaptive)Anthropic69.7%
4Claude Opus 4.6Anthropic · Closed
5GPT-5.5OpenAI · Closed
+28 more
swe Atlas Refactoring

1 models

1OpenAI59.0%
inference Bench

28 models

4Claude Fable 5Anthropic · Closed8.74x
5Claude Opus 4.7Anthropic · Closed8.53x
6GPT-6 AstraOpenAI · Closed7.90x
7Claude Opus 4.8Anthropic · Closed7.60x
9GPT-5.6 SolOpenAI · Closed7.34x
+23 more
bfcl V4

22 models

1BTL-3Bad Theory Labs88.5%
2Atria Dawn PreviewShanghai Artificial Intelligence Laboratory77.0%
3Qwen3.7 MaxAlibaba75.0%
4BTL-4Bad Theory Labs · Open weight
5Ling 3.0 FlashInclusionAI · Open weight
+17 more
mle Bench Lite

3 models

1Atria Dawn PreviewShanghai Artificial Intelligence Laboratory86.2%
2MiniMax M2.7MiniMax66.6%
3Agents-A1-4BInternScience22.7%
mm Claw Bench

2 models

1MiniMax M2.7MiniMax62.7%
2MiMo-V2.5Xiaomi23.8%
claw Eval

26 models

1Claude Opus 4.6Anthropic70.4%
2Step 3.7 FlashStepFun68.3%
3Claude Sonnet 4.6Anthropic67.8%
4MiMo-V2.5-ProXiaomi · Closed
5Muse SparkMeta · Closed
+21 more
qwen Claw Bench

10 models

1Qwen3.7 MaxAlibaba64.3%
2Qwen3.7 PlusAlibaba61.8%
3Qwen 3.6 Max (preview)Alibaba59.0%
4Qwen3.6 PlusAlibaba · Closed
5Kimi K2.5Moonshot AI · Open weight
+5 more
qwen Web Bench

5 models

1Qwen3.7 MaxAlibaba1568
2Qwen3.7 PlusAlibaba1536
3Qwen 3.6 Max (preview)Alibaba1532
4Qwen3.6-27BAlibaba · Open weight
5Qwen3.6-35B-A3BAlibaba · Open weight
tau3 Bench

17 models

1Mercury 2.5Inceptionτ³-bench Telecom
2Mistral Medium 3.5 128BMistralτ³-bench Telecom
4Nemotron 3 UltraNVIDIA · Open weight70.9%
5Qwen3.6 PlusAlibaba · Closed70.7%
6GLM-5.1Z.AI · Open weight70.6%
+12 more
vita Bench

12 models

1Qwen3.7 MaxAlibaba47.9%
2Qwen3.7 PlusAlibaba45.6%
3Qwen3.6 PlusAlibaba44.3%
4Qwen3.5 397BAlibaba · Open weight
5Agents-A1-4BInternScience · Open weight
+7 more
deep Planning

7 models

1Qwen3.7 PlusAlibaba62.3%
2Qwen3.6 PlusAlibaba41.5%
3Qwen3.5 397BAlibaba37.6%
4Claude Opus 4.5Anthropic · Closed
5Qwen3.6-35B-A3BAlibaba · Open weight
+2 more
mcp Tasks

5 models

1Qwen3.5 397BAlibaba74.2%
2Qwen3.6 PlusAlibaba74.1%
3Claude Opus 4.5Anthropic71.8%
4GLM-5Z.AI · Open weight
5Kimi K2.5Moonshot AI · Open weight
wide Research

15 models

1Mercury 2Inception92.3%
2Hy4 previewTencent83.9%
3Qwen3.8 MaxAlibaba81.9%
5Kimi K2.6Moonshot AI · Open weight
6Ornith-1.5-397BOrnith AI · Open weight
+10 more
gaia

1 models

1Agents-A1-4BInternScience95.1%
tau Bench

0 models

web Arena

0 models

mewc

1 models

1MiniMax M2.5MiniMax74.4%
finance Agent V2

62 models

1Gemini 3.8 FlashGooglehigh reasoning
2Muse Spark 1.2Metaxhigh reasoning
3Metamax reasoning60.0%
4Gemini 3.7 FlashGoogle · Closed59.0%
5Muse Spark 1.3Meta · Closed58.9%
+57 more