context.vn

aa Mmmu Pro

92 models evaluated

#ModelProviderTypeScore
1Claude Opus 5AnthropicClosedclaude-opus-5
2Gemini 3.5 FlashGoogleClosedgemini-3-5-flash
3GPT-5.6 SolOpenAIClosedgpt-5-6-sol
4Gemini 3.6 FlashGoogle · Closed83.2%
5Gemini 3.1 ProGoogle · Closed82.4%
6GPT-5.6 TerraOpenAI · Closed80.7%
7Qwen3.7 PlusAlibaba · Closed80.5%
8Kimi K3Moonshot AI · Closed80.5%
9Muse SparkMeta · Closed80.5%
10Grok 4.5xAI · Closed80.4%
11Gemini 3 ProGoogle · Closed80.2%
12GPT-5.5OpenAI · Closed79.9%
13Kimi K2.6Moonshot AI · Open weight79.4%
14Gemini 3.5 Flash-LiteGoogle · Closed79.0%
15Claude Opus 4.7 (Adaptive)Anthropic · Closed78.8%
16GPT-5.6 LunaOpenAI · Closed78.6%
17MiniMax M3MiniMax · Open weight78.6%
18Gemini 3 FlashGoogle · Closed78.6%
19GPT-5.3 CodexOpenAI · Closed78.5%
20GPT-5.3-Codex-SparkOpenAI · Closed78.5%
21GPT-5.4OpenAI · Closed78.4%
22Grok 4.3xAI · Closed78.1%
23Qwen3.6 PlusAlibaba · Closed78.0%
24Claude Sonnet 5Anthropic · Closed77.3%
25Qwen3.5 397BAlibaba · Open weight77.3%
26Qwen3.5 397B (Reasoning)Alibaba · Open weight77.3%
27Claude Opus 4.7Anthropic · Closed76.4%
28GPT-5.2-CodexOpenAI · Closed76.3%
29GPT-5.1OpenAI · Closed75.5%
30Gemini 3.1 Flash-LiteGoogle · Closed75.5%
31Kimi K2.5Moonshot AI · Open weight75.4%
32Kimi K2.5 (Reasoning)Moonshot AI · Closed75.4%
33Claude Opus 4.6 (Adaptive)Anthropic · Closed75.4%
34Step 3.7 FlashStepFun · Open weight75.3%
35Qwen3.5-122B-A10BAlibaba · Open weight75.0%
36Qwen3.5-27BAlibaba · Open weight75.0%
37Qwen3.6-35B-A3BAlibaba · Open weight75.0%
38Gemini 2.5 ProGoogle · Closed74.9%
39Qwen3.6-27BAlibaba · Open weight74.6%
40GPT-5 (medium)OpenAI · Closed74.3%
41GPT-5 (high)OpenAI · Closed74.2%
42Claude Opus 4.5 ThinkingAnthropic · Closed74.0%
43InklingThinking Machines Lab · Open weight73.5%
44Gemma 4 31BGoogle · Open weight73.4%
45GPT-5.4 miniOpenAI · Closed73.3%
46GLM-5V-TurboZ.AI · Closed72.8%
47Qwen3.5-35B-A3BAlibaba · Open weight72.7%
48Claude Opus 4.6Anthropic · Closed72.5%
49GPT-5.1-Codex-MaxOpenAI · Closed72.5%
50GPT-5.1-CodexOpenAI · Closed72.5%
51Claude Opus 4.5Anthropic · Closed71.2%
52Claude Sonnet 4.6Anthropic · Closed70.6%
53o3OpenAI · Closed70.1%
54GPT-5 miniOpenAI · Closed70.1%
55MiMo-V2-OmniXiaomi · Closed69.9%
56Gemma 4 12BGoogle · Open weight69.7%
57Gemma 4 26B A4BGoogle · Open weight69.2%
58Grok 4xAI · Closed68.8%
59Claude 4.1 Opus ThinkingAnthropic · Closed67.9%
60Gemini 2.5 FlashGoogle · Closed65.5%
61GPT-5.4 nanoOpenAI · Closed65.4%
62Mistral Medium 3.5 128BMistral · Open weight64.9%
63Grok 4.1 Fast (Reasoning)xAI · Closed63.3%
64Command A+Cohere · Open weight63.2%
65Claude 4 SonnetAnthropic · Closed62.4%
66Llama 4 MaverickMeta · Open weight62.1%
67Grok 4 Fast (Reasoning)xAI · Closed61.8%
68GPT-4.1OpenAI · Closed61.2%
69GPT-5 nanoOpenAI · Closed61.0%
70GPT-4.1 miniOpenAI · Closed58.7%
71Mistral Small 4Mistral · Open weight56.8%
72Mistral Small 4 (Reasoning)Mistral · Open weight56.8%
73Mistral Large 3Mistral · Closed55.7%
74Gemini 1.5 ProGoogle · Closed55.0%
75Nemotron 3 Nano Omni 30B A3BNVIDIA · Open weight53.2%
76Mistral Medium 3Mistral · Closed53.0%
77Llama 4 ScoutMeta · Open weight52.9%
78Gemma 4 E4BGoogle · Open weight51.4%
79Ministral 3 14B (Reasoning)Mistral · Open weight49.8%
80Ministral 3 14BMistral · Open weight49.8%
81Grok 4.1 FastxAI · Closed48.4%
82Gemma 3 27BGoogle · Open weight48.0%
83Ministral 3 8B (Reasoning)Mistral · Open weight46.0%
84Ministral 3 8BMistral · Open weight46.0%
85Gemma 4 E2BGoogle · Open weight44.6%
86Nova ProAmazon · Closed44.3%
87GPT-4o miniOpenAI · Closed41.5%
88GPT-4.1 nanoOpenAI · Closed40.1%
89Ministral 3 3B (Reasoning)Mistral · Open weight38.1%
90Ministral 3 3BMistral · Open weight38.1%
91Claude 3 HaikuAnthropic · Closed30.8%
92LFM2.5-VL-1.6B-ExtractLiquidAI · Open weight26.5%