context.vn

ifeval

21 models evaluated

#ModelProviderTypeScore
4Qwen3.7 MaxAlibaba · ClosedIFEval metric view not recorded94.3%
5Qwen3.6 PlusAlibaba · ClosedIFEval metric view not recorded94.3%
6Kimi K2.5Moonshot AI · Open weightIFEval metric view not recorded93.9%
7o3-miniOpenAI · ClosedIFEval metric view not recorded93.9%
8Qwen3.5-122B-A10BAlibaba · Open weightIFEval metric view not recorded93.4%
9GLM-5Z.AI · Open weightIFEval metric view not recorded92.6%
10Qwen3.5 397BAlibaba · Open weightIFEval metric view not recorded92.6%
11o1OpenAI · ClosedIFEval metric view not recorded92.2%
12Qwen3.5-35B-A3BAlibaba · Open weightIFEval metric view not recorded91.9%
13LFM2.5-8B-A1BLiquidAI · Open weightIFEval metric view not recorded91.8%
14Claude Opus 4.5Anthropic · ClosedIFEval metric view not recorded90.9%
15GPT-4.1 miniOpenAI · ClosedIFEval metric view not recorded88.5%
16GPT-4.1OpenAI · ClosedIFEval metric view not recorded87.4%
17DeepSeek V3DeepSeek · Open weightIFEval metric view not recorded86.1%
18ZAYA1-8BZyphra · Open weightIFEval metric view not recorded85.6%
19GPT-4.1 nanoOpenAI · ClosedIFEval metric view not recorded83.2%
20MiniCPM5-1BOpenBMB · Open weightIFEval metric view not recorded80.4%
21Mellum2-12B-A2.5B-ThinkingJetBrains · Open weightIFEval metric view not recorded76.5%
22Mellum2-12B-A2.5B-InstructJetBrains · Open weightIFEval metric view not recorded75.8%
23LFM2.5-230MLiquidAI · Open weightIFEval metric view not recorded71.7%
24LFM2.5-VL-450MLiquidAI · Open weightIFEval metric view not recorded61.2%