context.vn

Small Model Hub

3,378 efficient AI models across 7 domains · Charts · API

ScoreRaw benchmark score — scale varies by task
Showing 299 models
#ModelDomainTaskParams ↑GFLOPsVRAMScoreSpeedArchSource
1
SmolVLM-256M
MultimodalVision-Language260.0M624 MB
41.7MMBench
OpenVLM
2
SmolVLM2-256M
MultimodalVision-Language260.0M624 MB
11.9MMBench
OpenVLM
3
SmolVLM-500M
MultimodalVision-Language510.0M1.2 GB
53.8MMBench
OpenVLM
4
SmolVLM2-500M
MultimodalVision-Language510.0M1.2 GB
53.1MMBench
OpenVLM
5
H2OVL-800M
MultimodalVision-Language830.0M1.9 GB
56.3MMBench
OpenVLM
6
InternVL3-1B
MultimodalVision-Language940.0M2.2 GB
72.3MMBench
OpenVLM
7
InternVL2-1B
MultimodalVision-Language1.0B2.3 GB
65.2MMBench
OpenVLM
8
LLaVA-OneVision-0.5B
MultimodalVision-Language1.0B2.3 GB
61.6MMBench
OpenVLM
9
LLaVA-OneVision-0.5B (SI)
MultimodalVision-Language1.0B2.3 GB
55.8MMBench
OpenVLM
10
InternVL2.5-1B
MultimodalVision-Language1.0B2.3 GB
OpenVLM
11
InternVL2.5-1B-MPO
MultimodalVision-Language1.0B2.3 GB
70.1MMBench
OpenVLM
12
Ovis2-1B
MultimodalVision-Language1.3B3.0 GB
71.6MMBench
OpenVLM
13
Kosmos2
MultimodalVision-Language1.7B4.0 GB
1.1MMBench
OpenVLM
14
Moondream1
MultimodalVision-Language1.9B4.5 GB
62.3MMBench
OpenVLM
15
Moondream2
MultimodalVision-Language1.9B4.5 GB
70.0MMBench
OpenVLM
16
InternLM-XComposer2-1.8B
MultimodalVision-Language2.0B4.7 GB
73.0MMBench
OpenVLM
17
DeepSeek-VL-1.3B
MultimodalVision-Language2.0B4.7 GB
66.4MMBench
OpenVLM
18
Mini-InternVL-Chat-2B-V1.5
MultimodalVision-Language2.0B4.7 GB
70.7MMBench
OpenVLM
19
InternVL2-2B
MultimodalVision-Language2.0B4.7 GB
73.4MMBench
OpenVLM
20
Qwen2-VL-2B
MultimodalVision-Language2.0B4.7 GB
74.6MMBench
OpenVLM
21
XinYuan-VL-2B-Instruct
MultimodalVision-Language2.0B4.7 GB
78.4MMBench
OpenVLM
22
InternVL2.5-2B
MultimodalVision-Language2.0B4.7 GB
OpenVLM
23
InternVL2.5-2B-MPO
MultimodalVision-Language2.0B4.7 GB
74.5MMBench
OpenVLM
24
ShowUI
ui-understandingelement-groundinggui-agent
MultimodalUI Understanding2.0B4.7 GB
75.1ScreenSpot
Qwen2-VL-2B + UI-guided token selectionCurated
25
UI-TARS-2B (ByteDance)
ui-understandinggui-agentelement-grounding
MultimodalUI Understanding2.0B4.7 GB
83.8ScreenSpot
Qwen2-VL-2B fine-tunedCurated
26
InternVL3-2B
MultimodalVision-Language2.1B4.9 GB
80.8MMBench
OpenVLM
27
QTuneVL1.5-2B
MultimodalVision-Language2.1B4.9 GB
OpenVLM
28
Janus-1.3B
MultimodalVision-Language2.1B4.9 GB
52.0MMBench
OpenVLM
29
SAIL-VL-2B
MultimodalVision-Language2.1B4.9 GB
79.0MMBench
OpenVLM
30
VARCO-VISION-2.0-1.7B
MultimodalVision-Language2.1B5.0 GB
OpenVLM
31
MiniMonkey
MultimodalVision-Language2.2B5.2 GB
72.4MMBench
OpenVLM
32
Aquila-VL-2B
MultimodalVision-Language2.2B5.2 GB
79.0MMBench
OpenVLM
33
H2OVL-2B
MultimodalVision-Language2.2B5.2 GB
72.1MMBench
OpenVLM
34
QTuneVL1-2B
MultimodalVision-Language2.2B5.2 GB
OpenVLM
35
SmolVLM2
MultimodalVision-Language2.3B5.3 GB
71.4MMBench
OpenVLM
36
SmolVLM-Instruct
MultimodalVision-Language2.3B5.4 GB
67.5MMBench
OpenVLM
37
SmolVLM-Instruct-DPO
MultimodalVision-Language2.3B5.4 GB
65.0MMBench
OpenVLM
38
SmolVLM-Synthetic
MultimodalVision-Language2.3B5.4 GB
53.7MMBench
OpenVLM
39
HawkVL-2B
MultimodalVision-Language2.4B5.7 GB
OpenVLM
40
Ovis2-2B
MultimodalVision-Language2.5B5.8 GB
78.6MMBench
OpenVLM
41
SAIL-VL-1.5-2B
MultimodalVision-Language2.5B5.8 GB
OpenVLM
42
Flash-VL-2B-Dynamic-ISS
MultimodalVision-Language2.5B5.9 GB
OpenVLM
43
MiniCPM-V-2
MultimodalVision-Language2.8B6.6 GB
69.1MMBench
OpenVLM
44
BlueLM-2.5-3B
MultimodalVision-Language2.9B6.8 GB
OpenVLM
45
granite-vision-3.1-2b-preview
MultimodalVision-Language3.0B7.0 GB
OpenVLM
46
granite-vision-3.2-2b
MultimodalVision-Language3.0B7.0 GB
78.1MMBench
OpenVLM
47
granite-vision-3.3-2b
MultimodalVision-Language3.0B7.0 GB
73.5MMBench
OpenVLM
48
PaliGemma-3B-mix-448
MultimodalVision-Language3.0B7.0 GB
71.0MMBench
OpenVLM
49
MiniCPM-V
MultimodalVision-Language3.0B7.0 GB
64.1MMBench
OpenVLM
50
VILA1.5-3B
MultimodalVision-Language3.0B7.0 GB
64.5MMBench
OpenVLM
51
BlueLM-V-3B
MultimodalVision-Language3.0B7.0 GB
84.1MMBench
OpenVLM
52
BlueLM-2.6-3B
MultimodalVision-Language3.0B7.0 GB
OpenVLM
53
DeepSeek-VL2-Tiny
MultimodalVision-Language3.4B8.0 GB
74.6MMBench
OpenVLM
54
Ovis-U1-3B
MultimodalVision-Language3.6B8.5 GB
OpenVLM
55
Vintern-3B-beta
MultimodalVision-Language3.7B8.7 GB
70.6MMBench
OpenVLM
56
Vintern-1B-v2
MultimodalVision-Language3.7B8.7 GB
OpenVLM
57
Qwen2.5-VL-3B
MultimodalVision-Language3.8B8.8 GB
79.1MMBench
OpenVLM
58
QTuneVL1.5-3B
MultimodalVision-Language3.8B8.8 GB
OpenVLM
59
Ristretto-3B
MultimodalVision-Language3.8B9.0 GB
OpenVLM
60
Mini-InternVL-Chat-4B-V1.5
MultimodalVision-Language4.0B9.4 GB
75.7MMBench
OpenVLM
61
InternVL2-4B
MultimodalVision-Language4.0B9.4 GB
78.5MMBench
OpenVLM
62
Phi-3.5-Vision
MultimodalVision-Language4.0B9.4 GB
76.0MMBench
OpenVLM
63
InternVL2.5-4B
MultimodalVision-Language4.0B9.4 GB
OpenVLM
64
InternVL2.5-4B-MPO
MultimodalVision-Language4.0B9.4 GB
80.4MMBench
OpenVLM
65
Ovis1.6-Llama3.2-3B
MultimodalVision-Language4.1B9.6 GB
78.5MMBench
OpenVLM
66
Phi-3-Vision
MultimodalVision-Language4.2B9.8 GB
73.6MMBench
OpenVLM
67
Gemma3-4B
MultimodalVision-Language4.3B10.1 GB
69.6MMBench
OpenVLM
68
AKI-4B
MultimodalVision-Language4.3B10.1 GB
68.8MMBench
OpenVLM
69
XGen-MM-Instruct-Interleave-v1.5
MultimodalVision-Language4.4B10.3 GB
78.3MMBench
OpenVLM
70
XGen-MM-Instruct-DPO-v1.5
MultimodalVision-Language4.4B10.3 GB
78.0MMBench
OpenVLM
71
Ovis2-4B
MultimodalVision-Language4.6B10.8 GB
83.6MMBench
OpenVLM
72
R-4B
MultimodalVision-Language4.8B11.3 GB
OpenVLM
73
ScreenAI (Google)
ui-understandingscreenshot-qascreen2words
MultimodalUI Understanding5.0B11.7 GB
PaLI-based VLMCurated
74
Phi-4-MultiModal
MultimodalVision-Language5.6B13.1 GB
83.4MMBench
OpenVLM
75
Yi-VL-6B
MultimodalVision-Language6.6B15.5 GB
68.4MMBench
OpenVLM
76
InternLM-XComposer2
MultimodalVision-Language7.0B16.4 GB
80.7MMBench
OpenVLM
77
InternLM-XComposer2-4KHD
MultimodalVision-Language7.0B16.4 GB
80.2MMBench
OpenVLM
78
WeMM
MultimodalVision-Language7.0B16.4 GB
79.3MMBench
OpenVLM
79
Chameleon-7B
MultimodalVision-Language7.0B16.4 GB
15.4MMBench
OpenVLM
80
Slime-7B
MultimodalVision-Language7.0B16.4 GB
65.8MMBench
OpenVLM
81
MUG-U-7B
MultimodalVision-Language7.0B16.4 GB
83.9MMBench
OpenVLM
82
Ferret-UI (Apple)
ui-understandingscreenshot-analysiselement-grounding
MultimodalUI Understanding7.0B16.4 GB
87.0ScreenSpot
Ferret + any-resolutionCurated
83
Ferret-UI 2 (Apple)
ui-understandingscreenshot-analysiselement-grounding
MultimodalUI Understanding7.0B16.4 GB
Ferret-UI + multi-platformCurated
84
UI-TARS-7B (ByteDance)
ui-understandinggui-agentelement-grounding
MultimodalUI Understanding7.0B16.4 GB
90.3ScreenSpot
Qwen2-VL-7B fine-tunedCurated
85
UGround (UIX-Qwen2-7B)
ui-understandingelement-grounding
MultimodalUI Understanding7.0B16.4 GB
82.8ScreenSpot
Qwen2-VL-7B fine-tunedCurated
86
Aguvis-7B
ui-understandinggui-agentelement-grounding
MultimodalUI Understanding7.0B16.4 GB
Qwen2-VL-7B fine-tunedCurated
87
OS-Atlas-Pro-7B
ui-understandinggui-agentelement-grounding
MultimodalUI Understanding7.0B16.4 GB
84.6ScreenSpot
InternVL2-basedCurated
88
LLaVA-Next-Vicuna-7B
MultimodalVision-Language7.1B16.6 GB
69.2MMBench
OpenVLM
89
LLaVA-v1.5-7B (QLoRA)
MultimodalVision-Language7.2B16.9 GB
67.7MMBench
OpenVLM
90
ShareGPT4V-7B
MultimodalVision-Language7.2B16.9 GB
67.6MMBench
OpenVLM
91
LLaVA-v1.5-7B
MultimodalVision-Language7.2B16.9 GB
66.5MMBench
OpenVLM
92
LLaVA-v1-7B
MultimodalVision-Language7.2B16.9 GB
43.8MMBench
OpenVLM
93
MolmoE-1B
MultimodalVision-Language7.2B16.9 GB
64.6MMBench
OpenVLM
94
DeepSeek-VL-7B
MultimodalVision-Language7.3B17.1 GB
73.8MMBench
OpenVLM
95
Janus-Pro-7B
MultimodalVision-Language7.4B17.4 GB
62.6MMBench
OpenVLM
96
LLaVA-Next-Mistral-7B
MultimodalVision-Language7.6B17.8 GB
69.6MMBench
OpenVLM
97
LLaVA-InternLM-7B (QLoRA)
MultimodalVision-Language7.6B17.8 GB
69.0MMBench
OpenVLM
98
MMAlaya
MultimodalVision-Language7.8B18.3 GB
58.7MMBench
OpenVLM
99
InternVL3-8B
MultimodalVision-Language7.9B18.6 GB
83.6MMBench
OpenVLM
100
SAIL-VL-1.5-8B
MultimodalVision-Language8.0B18.6 GB
OpenVLM
101
MiniCPM-Llama3-V2.5
MultimodalVision-Language8.0B18.8 GB
77.6MMBench
OpenVLM
102
IDEFICS2-8B
MultimodalVision-Language8.0B18.8 GB
75.7MMBench
OpenVLM
103
InternLM-XComposer
MultimodalVision-Language8.0B18.8 GB
74.4MMBench
OpenVLM
104
LLaVA-LLaMA-3-8B
MultimodalVision-Language8.0B18.8 GB
71.7MMBench
OpenVLM
105
ShareCaptioner
MultimodalVision-Language8.0B18.8 GB
66.5MMBench
OpenVLM
106
VisualGLM
MultimodalVision-Language8.0B18.8 GB
37.6MMBench
OpenVLM
107
InstructBLIP-7B
MultimodalVision-Language8.0B18.8 GB
33.9MMBench
OpenVLM
108
MiniGPT-4-v1-7B
MultimodalVision-Language8.0B18.8 GB
23.0MMBench
OpenVLM
109
MiniGPT-4-v2
MultimodalVision-Language8.0B18.8 GB
9.4MMBench
OpenVLM
110
InternVL2-8B
MultimodalVision-Language8.0B18.8 GB
82.0MMBench
OpenVLM
111
Cambrian-8B
MultimodalVision-Language8.0B18.8 GB
74.6MMBench
OpenVLM
112
InternLM-XComposer2.5
MultimodalVision-Language8.0B18.8 GB
82.0MMBench
OpenVLM
113
Bunny-Llama3-8B
MultimodalVision-Language8.0B18.8 GB
78.3MMBench
OpenVLM
114
Ovis1.5-Llama3-8B
MultimodalVision-Language8.0B18.8 GB
80.8MMBench
OpenVLM
115
LLaVA-Next-Llama3
MultimodalVision-Language8.0B18.8 GB
74.8MMBench
OpenVLM
116
LLaVA-Next-Interleave-7B-DPO
MultimodalVision-Language8.0B18.8 GB
73.8MMBench
OpenVLM
117
LLaVA-Next-Interleave-7B
MultimodalVision-Language8.0B18.8 GB
74.7MMBench
OpenVLM
118
Mantis-8B-clip-llama3
MultimodalVision-Language8.0B18.8 GB
68.2MMBench
OpenVLM
119
Mantis-8B-siglip-llama3
MultimodalVision-Language8.0B18.8 GB
69.0MMBench
OpenVLM
120
Mantis-8B-Idefics2
MultimodalVision-Language8.0B18.8 GB
76.0MMBench
OpenVLM
121
MiniCPM-V-2.6
MultimodalVision-Language8.0B18.8 GB
81.5MMBench
OpenVLM
122
Llama-3-MixSense-v1.1
MultimodalVision-Language8.0B18.8 GB
77.0MMBench
OpenVLM
123
Parrot-7B
MultimodalVision-Language8.0B18.8 GB
72.0MMBench
OpenVLM
124
Llama-3-VILA1.5-8B
MultimodalVision-Language8.0B18.8 GB
62.1MMBench
OpenVLM
125
Idefics3-8B-Llama3
MultimodalVision-Language8.0B18.8 GB
77.5MMBench
OpenVLM
126
Qwen2-VL-7B
MultimodalVision-Language8.0B18.8 GB
82.8MMBench
OpenVLM
127
Mantis-8B-Fuyu
MultimodalVision-Language8.0B18.8 GB
46.6MMBench
OpenVLM
128
Slime-8B
MultimodalVision-Language8.0B18.8 GB
72.8MMBench
OpenVLM
129
LLaVA-OneVision-7B
MultimodalVision-Language8.0B18.8 GB
83.2MMBench
OpenVLM
130
LLaVA-OneVision-7B (SI)
MultimodalVision-Language8.0B18.8 GB
80.5MMBench
OpenVLM
131
Molmo-7B-D
MultimodalVision-Language8.0B18.8 GB
73.6MMBench
OpenVLM
132
Molmo-7B-O
MultimodalVision-Language8.0B18.8 GB
72.2MMBench
OpenVLM
133
InternVL2-8B-MPO
MultimodalVision-Language8.0B18.8 GB
79.2MMBench
OpenVLM
134
InternVL2-8B-MPO-CoT
MultimodalVision-Language8.0B18.8 GB
78.3MMBench
OpenVLM
135
InternVL2.5-8B
MultimodalVision-Language8.0B18.8 GB
OpenVLM
136
InternVL2.5-8B-MPO
MultimodalVision-Language8.0B18.8 GB
83.9MMBench
OpenVLM
137
LLaVA-InternLM2-7B (QLoRA)
MultimodalVision-Language8.1B19.0 GB
73.3MMBench
OpenVLM
138
mPLUG-Owl2
MultimodalVision-Language8.2B19.2 GB
66.0MMBench
OpenVLM
139
Ross-Qwen2-7B
MultimodalVision-Language8.2B19.2 GB
80.5MMBench
OpenVLM
140
Qwen2.5-VL-7B
MultimodalVision-Language8.3B19.4 GB
83.2MMBench
OpenVLM
141
WeThink-Qwen2.5VL-7B
MultimodalVision-Language8.3B19.4 GB
OpenVLM
142
POINTS-Qwen2.5-7B
MultimodalVision-Language8.3B19.5 GB
81.4MMBench
OpenVLM
143
POINTS1.5-Qwen2.5-7B
MultimodalVision-Language8.3B19.5 GB
82.8MMBench
OpenVLM
144
VITA-1.5
MultimodalVision-Language8.3B19.5 GB
79.8MMBench
OpenVLM
145
MiMo-VL-7B
MultimodalVision-Language8.3B19.5 GB
OpenVLM
146
SAIL-VL-1.6-8B
MultimodalVision-Language8.3B19.5 GB
OpenVLM
147
Emu3_chat
MultimodalVision-Language8.5B19.9 GB
63.8MMBench
OpenVLM
148
MiniCPM-o-2.6
MultimodalVision-Language8.7B20.3 GB
83.4MMBench
OpenVLM
149
Ola-7b
MultimodalVision-Language8.9B20.8 GB
87.4MMBench
OpenVLM
150
valley2
MultimodalVision-Language8.9B20.8 GB
OpenVLM
151
valley2_dpo
MultimodalVision-Language8.9B20.8 GB
OpenVLM
152
Valley-Eagle
MultimodalVision-Language8.9B20.9 GB
OpenVLM
153
Ovis2-8B
MultimodalVision-Language8.9B21.0 GB
84.8MMBench
OpenVLM
154
IDEFICS-9B-Instruct
MultimodalVision-Language9.0B21.1 GB
45.3MMBench
OpenVLM
155
OpenFlamingo v2
MultimodalVision-Language9.0B21.1 GB
5.7MMBench
OpenVLM
156
GLM-4v-9B
MultimodalVision-Language9.0B21.1 GB
71.4MMBench
OpenVLM
157
Eagle-X5-7B
MultimodalVision-Language9.0B21.1 GB
70.1MMBench
OpenVLM
158
InternVL3-9B
MultimodalVision-Language9.1B21.4 GB
83.9MMBench
OpenVLM
159
POINTS-Yi-1.5-9B
MultimodalVision-Language9.5B22.3 GB
81.6MMBench
OpenVLM
160
Qwen-VL-Chat
MultimodalVision-Language9.6B22.5 GB
61.8MMBench
OpenVLM
161
Qwen-VL
MultimodalVision-Language9.6B22.5 GB
32.2MMBench
OpenVLM
162
SeeClick
ui-understandingelement-groundinggui-agent
MultimodalUI Understanding9.6B22.5 GB
73.4ScreenSpot
Qwen-VL + GUI groundingCurated
163
Monkey-Chat
MultimodalVision-Language9.8B23.0 GB
72.4MMBench
OpenVLM
164
Monkey
MultimodalVision-Language9.8B23.0 GB
59.6MMBench
OpenVLM
165
Ovis1.6-Gemma2-9B
MultimodalVision-Language10.2B23.9 GB
83.4MMBench
OpenVLM
166
Llama-3.2-11B-Vision-Instruct
MultimodalVision-Language11.0B25.8 GB
68.0MMBench
OpenVLM
167
LLaVA-CoT
MultimodalVision-Language11.0B25.8 GB
OpenVLM
168
Ovis1.5-Gemma2-9B
MultimodalVision-Language11.4B26.7 GB
80.9MMBench
OpenVLM
169
Falcon2-VLM-11B
MultimodalVision-Language11.4B26.7 GB
70.7MMBench
OpenVLM
170
OmniLMM-12B
MultimodalVision-Language12.0B28.1 GB
71.7MMBench
OpenVLM
171
Gemma3-12B
MultimodalVision-Language12.2B28.6 GB
77.5MMBench
OpenVLM
172
XVERSE-V-13B
MultimodalVision-Language13.0B30.5 GB
75.4MMBench
OpenVLM
173
Cambrian-13B
MultimodalVision-Language13.0B30.5 GB
73.2MMBench
OpenVLM
174
OmChat-v2.0-13B
MultimodalVision-Language13.0B30.5 GB
82.6MMBench
OpenVLM
175
VILA1.5-13B
MultimodalVision-Language13.0B30.5 GB
74.4MMBench
OpenVLM
176
Slime-13B
MultimodalVision-Language13.0B30.5 GB
65.4MMBench
OpenVLM
177
Pixtral-12B
MultimodalVision-Language13.0B30.5 GB
77.9MMBench
OpenVLM
178
TransCore-M
MultimodalVision-Language13.4B31.4 GB
82.3MMBench
OpenVLM
179
LLaVA-Next-Vicuna-13B
MultimodalVision-Language13.4B31.4 GB
70.0MMBench
OpenVLM
180
ShareGPT4V-13B
MultimodalVision-Language13.4B31.4 GB
69.8MMBench
OpenVLM
181
LLaVA-v1.5-13B
MultimodalVision-Language13.4B31.4 GB
69.2MMBench
OpenVLM
182
LLaVA-v1.5-13B (QLoRA)
MultimodalVision-Language13.4B31.4 GB
68.8MMBench
OpenVLM
183
PandaGPT-13B
MultimodalVision-Language14.0B32.8 GB
42.5MMBench
OpenVLM
184
Long-VITA-16K
MultimodalVision-Language14.0B32.8 GB
OpenVLM
185
Eagle-X5-13B
MultimodalVision-Language15.0B35.2 GB
72.6MMBench
OpenVLM
186
InternVL3-14B
MultimodalVision-Language15.1B35.4 GB
85.7MMBench
OpenVLM
187
VARCO-VISION-14B
MultimodalVision-Language15.2B35.6 GB
85.1MMBench
OpenVLM
188
VARCO-VISION-2.0-14B
MultimodalVision-Language15.2B35.6 GB
OpenVLM
189
DeepSeek-VL2-Small
MultimodalVision-Language16.1B37.7 GB
82.8MMBench
OpenVLM
190
Ovis2-16B
MultimodalVision-Language16.2B38.0 GB
87.2MMBench
OpenVLM
191
Kimi-VL-A3B-Instruct
MultimodalVision-Language16.4B38.4 GB
82.1MMBench
OpenVLM
192
Kimi-VL-A3B-Thinking
MultimodalVision-Language16.4B38.4 GB
OpenVLM
193
Kimi-VL-A3B-Thinking-2506
MultimodalVision-Language16.4B38.4 GB
OpenVLM
194
CogVLM-17B-Chat
MultimodalVision-Language17.0B39.8 GB
65.8MMBench
OpenVLM
195
bailingMM-mini
MultimodalVision-Language17.0B39.8 GB
OpenVLM
196
CogAgent
ui-understandinggui-agentscreenshot-analysis
MultimodalUI Understanding18.0B42.2 GB
CogVLM + high-res cross-moduleCurated
197
CogVLM2-19B-Chat
MultimodalVision-Language19.0B44.5 GB
73.9MMBench
OpenVLM
198
LLaVA-InternLM2-20B (QLoRA)
MultimodalVision-Language20.2B47.3 GB
75.1MMBench
OpenVLM
199
BailingMM-Lite-1203
MultimodalVision-Language21.0B49.2 GB
84.0MMBench
OpenVLM
200
Aria
MultimodalVision-Language25.3B59.3 GB
80.0MMBench
OpenVLM
201
InternVL-Chat-V1.5
MultimodalVision-Language26.0B60.9 GB
82.3MMBench
OpenVLM
202
InternVL2-26B
MultimodalVision-Language26.0B60.9 GB
83.4MMBench
OpenVLM
203
MMAlaya2
MultimodalVision-Language26.0B60.9 GB
82.5MMBench
OpenVLM
204
InternVL2.5-26B
MultimodalVision-Language26.0B60.9 GB
OpenVLM
205
InternVL2.5-26B-MPO
MultimodalVision-Language26.0B60.9 GB
85.6MMBench
OpenVLM
206
Gemma3-27B
MultimodalVision-Language27.4B64.2 GB
82.3MMBench
OpenVLM
207
DeepSeek-VL2
MultimodalVision-Language27.5B64.5 GB
84.1MMBench
OpenVLM
208
Ovis1.6-Gemma2-27B
MultimodalVision-Language28.9B67.7 GB
84.8MMBench
OpenVLM
209
Chameleon-30B
MultimodalVision-Language30.0B70.3 GB
32.5MMBench
OpenVLM
210
KoreaDeep-VLM-OCR-32B
MultimodalVision-Language32.0B75.0 GB
OpenVLM
211
LLaVA-Next-Qwen-32B
MultimodalVision-Language33.0B77.3 GB
79.4MMBench
OpenVLM
212
Qwen2.5-VL-32B
MultimodalVision-Language33.5B78.5 GB
OpenVLM
213
Cambrian-34B
MultimodalVision-Language34.0B79.7 GB
80.4MMBench
OpenVLM
214
Yi-VL-34B
MultimodalVision-Language34.6B81.1 GB
72.4MMBench
OpenVLM
215
LLaVA-Next-Yi-34B
MultimodalVision-Language34.8B81.6 GB
81.1MMBench
OpenVLM
216
Ovis2-34B
MultimodalVision-Language34.9B81.8 GB
87.6MMBench
OpenVLM
217
Eagle-X5-34B-Chat
MultimodalVision-Language36.8B86.3 GB
80.0MMBench
OpenVLM
218
Emu2_chat
MultimodalVision-Language37.0B86.7 GB
63.6MMBench
OpenVLM
219
InternVL2.5-38B
MultimodalVision-Language38.0B89.1 GB
OpenVLM
220
InternVL2.5-38B-MPO
MultimodalVision-Language38.0B89.1 GB
86.4MMBench
OpenVLM
221
InternVL3-38B
MultimodalVision-Language38.4B90.0 GB
87.7MMBench
OpenVLM
222
InternVL2-40B
MultimodalVision-Language40.0B93.8 GB
86.8MMBench
OpenVLM
223
VILA1.5-40B
MultimodalVision-Language40.0B93.8 GB
81.7MMBench
OpenVLM
224
VITA
MultimodalVision-Language47.0B110.2 GB
OpenVLM
225
360VL-70B
MultimodalVision-Language70.0B164.1 GB
78.8MMBench
OpenVLM
226
Qwen-VL-Max-0809
MultimodalVision-Language72.0B168.8 GB
86.8MMBench
OpenVLM
227
UI-TARS-72B (ByteDance)
ui-understandinggui-agentelement-grounding
MultimodalUI Understanding72.0B168.8 GB
92.6ScreenSpot
Qwen2-VL-72B fine-tunedCurated
228
LLaVA-OneVision-72B (SI)
MultimodalVision-Language73.0B171.1 GB
OpenVLM
229
LLaVA-OneVision-72B
MultimodalVision-Language73.0B171.1 GB
85.8MMBench
OpenVLM
230
Molmo-72B
MultimodalVision-Language73.3B171.8 GB
OpenVLM
231
Qwen2-VL-72B
MultimodalVision-Language73.4B172.0 GB
86.9MMBench
OpenVLM
232
Qwen2.5-VL-72B
MultimodalVision-Language73.4B172.0 GB
88.3MMBench
OpenVLM
233
InternVL2-Llama3-76B
MultimodalVision-Language76.0B178.1 GB
86.5MMBench
OpenVLM
234
InternVL2.5-78B
MultimodalVision-Language78.0B182.8 GB
88.2MMBench
OpenVLM
235
InternVL2.5-78B-MPO
MultimodalVision-Language78.0B182.8 GB
88.4MMBench
OpenVLM
236
InternVL3-78B
MultimodalVision-Language78.4B183.8 GB
88.8MMBench
OpenVLM
237
RBDash-v1.5
MultimodalVision-Language79.0B185.2 GB
84.6MMBench
OpenVLM
238
NVLM-D-72B
MultimodalVision-Language79.4B186.1 GB
80.4MMBench
OpenVLM
239
IDEFICS-80B-Instruct
MultimodalVision-Language80.0B187.5 GB
54.6MMBench
OpenVLM
240
BailingMM-Pro-0120
MultimodalVision-Language81.0B189.8 GB
87.1MMBench
OpenVLM
241
Llama-3.2-90B-Vision-Instruct
MultimodalVision-Language88.6B207.7 GB
80.4MMBench
OpenVLM
242
GPT-4o (0513, detail-high)
MultimodalVision-Language
83.4MMBench
OpenVLM
243
GPT-4o (0513, detail-low)
MultimodalVision-Language
83.3MMBench
OpenVLM
244
GLM-4v
MultimodalVision-Language
81.3MMBench
OpenVLM
245
GPT-4v (0409, detail-high)
MultimodalVision-Language
81.0MMBench
OpenVLM
246
GPT-4v (0409, detail-low)
MultimodalVision-Language
80.8MMBench
OpenVLM
247
Qwen-VL-Max
MultimodalVision-Language
77.6MMBench
OpenVLM
248
GPT-4v (1106, detail-low)
MultimodalVision-Language
77.0MMBench
OpenVLM
249
RekaFlash
MultimodalVision-Language
76.8MMBench
OpenVLM
250
Gemini-1.0-Pro
MultimodalVision-Language
73.6MMBench
OpenVLM
251
Claude3-Sonnet
MultimodalVision-Language
67.8MMBench
OpenVLM
252
Qwen-VL-Plus
MultimodalVision-Language
67.0MMBench
OpenVLM
253
RekaEdge
MultimodalVision-Language
66.4MMBench
OpenVLM
254
GPT-4v (1106, detail-high)
MultimodalVision-Language
65.4MMBench
OpenVLM
255
Claude3-Opus
MultimodalVision-Language
63.3MMBench
OpenVLM
256
Claude3-Haiku
MultimodalVision-Language
60.7MMBench
OpenVLM
257
Gemini-1.5-Pro
MultimodalVision-Language
73.9MMBench
OpenVLM
258
Claude3.5-Sonnet
MultimodalVision-Language
79.7MMBench
OpenVLM
259
CongRong
MultimodalVision-Language
82.8MMBench
OpenVLM
260
GPT-4o-mini (0718, detail-high)
MultimodalVision-Language
77.6MMBench
OpenVLM
261
Yi-Vision
MultimodalVision-Language
78.1MMBench
OpenVLM
262
GPT-4o (0806, detail-high)
MultimodalVision-Language
82.1MMBench
OpenVLM
263
Step-1.5V
MultimodalVision-Language
85.3MMBench
OpenVLM
264
Gemini-1.5-Flash
MultimodalVision-Language
79.4MMBench
OpenVLM
265
Qwen-VL-Plus-0809
MultimodalVision-Language
82.7MMBench
OpenVLM
266
Claude3.5-Sonnet-20241022
MultimodalVision-Language
82.6MMBench
OpenVLM
267
Taiyi
MultimodalVision-Language
86.7MMBench
OpenVLM
268
JT-VL-Chat-V3.0
MultimodalVision-Language
OpenVLM
269
TeleMM
MultimodalVision-Language
OpenVLM
270
Gemini-1.5-Pro-002
MultimodalVision-Language
OpenVLM
271
Gemini-1.5-Flash-002
MultimodalVision-Language
OpenVLM
272
GPT-4o (1120, detail-high)
MultimodalVision-Language
OpenVLM
273
GLM-4v-Plus
MultimodalVision-Language
81.4MMBench
OpenVLM
274
Step-1.5V-mini
MultimodalVision-Language
18.1MMBench
OpenVLM
275
abab6.5s
MultimodalVision-Language
61.0MMBench
OpenVLM
276
abab7-preview
MultimodalVision-Language
84.5MMBench
OpenVLM
277
SenseNova
MultimodalVision-Language
OpenVLM
278
Gemini-2.0-Flash
MultimodalVision-Language
OpenVLM
279
Step-1o
MultimodalVision-Language
88.3MMBench
OpenVLM
280
HunYuan-Standard-Vision
MultimodalVision-Language
86.4MMBench
OpenVLM
281
GLM-4v-Plus-20250111
MultimodalVision-Language
88.9MMBench
OpenVLM
282
Gemini-2.0-Pro
MultimodalVision-Language
84.3MMBench
OpenVLM
283
Claude3.7-Sonnet
MultimodalVision-Language
81.4MMBench
OpenVLM
284
moonshot-v1-8k
MultimodalVision-Language
79.3MMBench
OpenVLM
285
grok-2-vision-1212
MultimodalVision-Language
85.3MMBench
OpenVLM
286
GPT-4.5
MultimodalVision-Language
OpenVLM
287
ChatGPT-4o-latest
MultimodalVision-Language
OpenVLM
288
Gemini-2.5-Pro
MultimodalVision-Language
OpenVLM
289
GPT-4.1-20250414
MultimodalVision-Language
86.9MMBench
OpenVLM
290
GPT-4.1-mini-20250414
MultimodalVision-Language
86.9MMBench
OpenVLM
291
GPT-4.1-nano-20250414
MultimodalVision-Language
68.2MMBench
OpenVLM
292
SenseNova-V6-Pro
MultimodalVision-Language
OpenVLM
293
CongRong-v2.0
MultimodalVision-Language
OpenVLM
294
GPT-5-20250807
MultimodalVision-Language
OpenVLM
295
GPT-5-nano-20250807
MultimodalVision-Language
OpenVLM
296
GPT-5-mini-20250807
MultimodalVision-Language
OpenVLM
297
SenseNova-V6-5-Pro
MultimodalVision-Language
OpenVLM
298
OmniParser (Microsoft)
ui-understandingscreenshot-parsingelement-detection
MultimodalUI Understanding
93.9ScreenSpot
Detection + OCR + Icon pipelineCurated
299
OmniParser V2 (Microsoft)
ui-understandingscreenshot-parsingelement-detection
MultimodalUI Understanding
Detection + OCR + Icon pipeline v2Curated