context.vn
Menu

BenchLM Benchmarks

219 benchmarks · 673 model scores · Data from Sep 23, 2026

Coding25 benchmarks

humaneval

2 models

1BTL-3Bad Theory Labs95.1%
3Soofi S 30B-A3BSoofi Project73.8%
big Code Bench

1 models

2Ternary Bonsai 2 27BPrism ML58.1%
codeforces

4 models

1DeepSeek V4.1 FlashDeepSeek3471.0
2DeepSeek V4 Pro 0813DeepSeek3206.0
3dots3-note PreviewDots Studio3056.0
4DeepSeek V4 Flash 0731DeepSeek · Closed
swe Verified

75 models

1Claude Opus 5Anthropic96%
2Claude Mythos 5Anthropic95.5%
3Claude Fable 5Anthropic95%
4Claude Opus 4.8Anthropic · Closed
5Claude Opus 4.7 (Adaptive)Anthropic · Closed
+70 more
swe Rebench

13 models

1Claude Opus 4.6Anthropic65.3%
2GLM-5Z.AI62.8%
3GLM-5.1Z.AI62.7%
4DeepSeek V3.2DeepSeek · Open weight
5Claude Sonnet 4.6Anthropic · Closed
+8 more
live Code Bench

8 models

1Qwen3.7 MaxAlibaba91.6%
2Qwen3.7 PlusAlibaba89.6%
3Solar Pro 4Upstage87.8%
4GLM-4.7Z.AI · Open weight
5Qwen3.6-27BAlibaba · Open weight
+3 more
live Code Bench V6

31 models

1Sakana Fugu-UltraSakana AI93.2%
2Sakana FuguSakana AI92.9%
3Qwen3.8-Omni-FlashAlibaba92.6%
4Solar Open 2Upstage · Open weight
5Qwen3.8-Flash-NextAlibaba · Open weight
+26 more
live Code Bench Pro

8 models

1Sakana Fugu-UltraSakana AI90.8%
2Sakana FuguSakana AI87.8%
3GPT-5.4OpenAI87.5%
4Gemini 3.1 ProGoogle · Closed
5Muse SparkMeta · Closed
+3 more
flteval

0 models

swe Pro

70 models

1Claude Opus 5.5Anthropic89.9%
2Claude Fable 5.1Anthropic81.2%
3Claude Mythos 5Anthropic80.3%
4Claude Fable 5Anthropic · Closed
5Claude Opus 5Anthropic · Closed
+65 more
swe Multilingual

42 models

1Claude Opus 5.5Anthropic93.9%
2Claude Opus 5Anthropic89.5%
3Claude Fable 5.1Anthropic89.1%
4Claude Opus 4.8Anthropic · Closed
5Hy4 previewTencent · Open weight
+37 more
swe Multimodal

5 models

1Claude Opus 5.5Anthropic61.4%
2Claude Opus 5Anthropic59.4%
3Claude Fable 5.1Anthropic54.7%
4Claude Opus 4.8Anthropic · Closed
5Claude Sonnet 5Anthropic · Closed
cursor Bench31

6 models

1Claude Opus 5.5Anthropic57.8%
2Claude Fable 5.1Anthropic51.8%
3Grok 4.7xAI46.3%
4GPT-5.6 SolOpenAI · Closed
5Gemini 3.8 FlashGoogle · Closed
+1 more
multi Swe Bench

1 models

1MiniMax M2.7MiniMax52.7%
vibe Pro

1 models

1MiniMax M2.7MiniMax55.6%
vibe Code Bench

96 models

1Claude Fable 5AnthropicOpenHands
2Claude Opus 5.5AnthropicOpenHands
3Claude Fable 5.1AnthropicOpenHands
4GPT-6 AstraOpenAI · ClosedOpenHands
5Claude Opus 5Anthropic · ClosedOpenHands
+91 more
program Bench

17 models

1Claude Opus 5Anthropic37.0%
2Claude Opus 4.8Anthropic16.5%
3GPT-5.6 SolOpenAI15.5%
4GPT-5.5OpenAI · Closed
5GLM-5.2Z.AI · Open weight
+12 more
nl2 Repo

29 models

1DeepSeek V4.1 FlashDeepSeek65.4%
2DeepSeek V4 Pro 0813DeepSeek61.5%
3Ornith-1.5-397BOrnith AI59.5%
4Hy4 previewTencent · Open weight
5GLM-5.3Z.AI · Open weight
+24 more
react Native Evals

16 models

1Composer 2Cursor96.1%
2Composer 2 FastCursor94.9%
3GPT-5.4OpenAI85.3%
4GPT-5.5OpenAI · Closed
5Claude Opus 4.6Anthropic · Closed
+11 more
swe Verified Arcee

5 models

1Claude Opus 4.6Anthropic75.6%
2MiniMax M2.7MiniMax75.4%
3GLM-5Z.AI72.8%
4Kimi K2.5Moonshot AI · Open weight
5Trinity-Large-ThinkingArcee AI · Open weight
spider2 Lite

1 models

1Interfaze BetaInterfaze52.9%
sci Code

28 models

1Sakana FuguSakana AI60.1%
2Step 5 PreviewStepFun58.9%
3Sakana Fugu-UltraSakana AI58.7%
4Qwen3.7 MaxAlibaba · Closed
5Gemini 3.5 FlashGoogle · Closed
+23 more
aa Coding Index

111 models

1Claude Fable 5.1Anthropic81.6%
2Claude Opus 5Anthropic78.0%
3GPT-5.6 SolOpenAI77.4%
4GPT-6 AstraOpenAI · Closed
5Grok 4.6xAI · Closed
+106 more
aa Sci Code

103 models

1Claude Opus 5.5Anthropic66.9%
2Claude Fable 5.1Anthropic63.1%
3Claude Fable 5Anthropic61.0%
4MiMo-V2.6-ProXiaomi · Open weight
5Kimi K3Moonshot AI · Closed
+98 more