context.vn
Menu

Small Model Hub

3,618 efficient AI models across 9 domains · Charts · API

ScorePercentile rank within each task — comparable across domains
Showing 305 models
#ModelDomainTaskParams ↑GFLOPsVRAMContextSpeedArchSource
1
OpenAI-Clip
MultimodalImage Classification150.0M—360 MB———Qualcomm AI Hub
2
SmolVLM-256M
MultimodalVision-Language260.0M—624 MB
5
——OpenVLM
3
SmolVLM2-256M
MultimodalVision-Language260.0M—624 MB
1
——OpenVLM
4
SmolVLM-500M
MultimodalVision-Language510.0M—1.2 GB
8
——OpenVLM
5
SmolVLM2-500M
MultimodalVision-Language510.0M—1.2 GB
7
——OpenVLM
6
H2OVL-800M
MultimodalVision-Language830.0M—1.9 GB
10
——OpenVLM
7
InternVL3-1B
MultimodalVision-Language940.0M—2.2 GB
37
——OpenVLM
8
InternVL2-1B
MultimodalVision-Language1.0B—2.3 GB
17
——OpenVLM
9
LLaVA-OneVision-0.5B
MultimodalVision-Language1.0B—2.3 GB
12
——OpenVLM
10
LLaVA-OneVision-0.5B (SI)
MultimodalVision-Language1.0B—2.3 GB
9
——OpenVLM
11
InternVL2.5-1B
MultimodalVision-Language1.0B—2.3 GB———OpenVLM
12
InternVL2.5-1B-MPO
MultimodalVision-Language1.0B—2.3 GB
30
——OpenVLM
13
Ovis2-1B
MultimodalVision-Language1.3B—3.0 GB
34
——OpenVLM
14
Kosmos2
MultimodalVision-Language1.7B—4.0 GB
0
——OpenVLM
15
Moondream1
MultimodalVision-Language1.9B—4.5 GB
13
——OpenVLM
16
Moondream2
MultimodalVision-Language1.9B—4.5 GB
30
——OpenVLM
17
InternLM-XComposer2-1.8B
MultimodalVision-Language2.0B—4.7 GB
39
——OpenVLM
18
DeepSeek-VL-1.3B
MultimodalVision-Language2.0B—4.7 GB
20
——OpenVLM
19
Mini-InternVL-Chat-2B-V1.5
MultimodalVision-Language2.0B—4.7 GB
32
——OpenVLM
20
InternVL2-2B
MultimodalVision-Language2.0B—4.7 GB
40
——OpenVLM
21
Qwen2-VL-2B
MultimodalVision-Language2.0B—4.7 GB
46
——OpenVLM
22
XinYuan-VL-2B-Instruct
MultimodalVision-Language2.0B—4.7 GB
57
——OpenVLM
23
InternVL2.5-2B
MultimodalVision-Language2.0B—4.7 GB———OpenVLM
24
InternVL2.5-2B-MPO
MultimodalVision-Language2.0B—4.7 GB
45
——OpenVLM
25
ShowUI
ui-understandingelement-groundinggui-agent
MultimodalUI Understanding2.0B—4.7 GB
13
—Qwen2-VL-2B + UI-guided token selectionCurated
26
UI-TARS-2B (ByteDance)
ui-understandinggui-agentelement-grounding
MultimodalUI Understanding2.0B—4.7 GB
38
—Qwen2-VL-2B fine-tunedCurated
27
InternVL3-2B
MultimodalVision-Language2.1B—4.9 GB
68
——OpenVLM
28
QTuneVL1.5-2B
MultimodalVision-Language2.1B—4.9 GB———OpenVLM
29
Janus-1.3B
MultimodalVision-Language2.1B—4.9 GB
7
——OpenVLM
30
SAIL-VL-2B
MultimodalVision-Language2.1B—4.9 GB
59
——OpenVLM
31
VARCO-VISION-2.0-1.7B
MultimodalVision-Language2.1B—5.0 GB———OpenVLM
32
MiniMonkey
MultimodalVision-Language2.2B—5.2 GB
37
——OpenVLM
33
Aquila-VL-2B
MultimodalVision-Language2.2B—5.2 GB
60
——OpenVLM
34
H2OVL-2B
MultimodalVision-Language2.2B—5.2 GB
36
——OpenVLM
35
QTuneVL1-2B
MultimodalVision-Language2.2B—5.2 GB———OpenVLM
36
SmolVLM2
MultimodalVision-Language2.3B—5.3 GB
33
——OpenVLM
37
SmolVLM-Instruct
MultimodalVision-Language2.3B—5.4 GB
22
——OpenVLM
38
SmolVLM-Instruct-DPO
MultimodalVision-Language2.3B—5.4 GB
17
——OpenVLM
39
SmolVLM-Synthetic
MultimodalVision-Language2.3B—5.4 GB
8
——OpenVLM
40
HawkVL-2B
MultimodalVision-Language2.4B—5.7 GB———OpenVLM
41
Ovis2-2B
MultimodalVision-Language2.5B—5.8 GB
58
——OpenVLM
42
SAIL-VL-1.5-2B
MultimodalVision-Language2.5B—5.8 GB———OpenVLM
43
Flash-VL-2B-Dynamic-ISS
MultimodalVision-Language2.5B—5.9 GB———OpenVLM
44
MiniCPM-V-2
MultimodalVision-Language2.8B—6.6 GB
27
——OpenVLM
45
BlueLM-2.5-3B
MultimodalVision-Language2.9B—6.8 GB———OpenVLM
46
granite-vision-3.1-2b-preview
MultimodalVision-Language3.0B—7.0 GB———OpenVLM
47
granite-vision-3.2-2b
MultimodalVision-Language3.0B—7.0 GB
55
——OpenVLM
48
granite-vision-3.3-2b
MultimodalVision-Language3.0B—7.0 GB
41
——OpenVLM
49
PaliGemma-3B-mix-448
MultimodalVision-Language3.0B—7.0 GB
33
——OpenVLM
50
MiniCPM-V
MultimodalVision-Language3.0B—7.0 GB
15
——OpenVLM
51
VILA1.5-3B
MultimodalVision-Language3.0B—7.0 GB
16
——OpenVLM
52
BlueLM-V-3B
MultimodalVision-Language3.0B—7.0 GB
87
——OpenVLM
53
BlueLM-2.6-3B
MultimodalVision-Language3.0B—7.0 GB———OpenVLM
54
DeepSeek-VL2-Tiny
MultimodalVision-Language3.4B—8.0 GB
46
——OpenVLM
55
Ovis-U1-3B
MultimodalVision-Language3.6B—8.5 GB———OpenVLM
56
Vintern-3B-beta
MultimodalVision-Language3.7B—8.7 GB
31
——OpenVLM
57
Vintern-1B-v2
MultimodalVision-Language3.7B—8.7 GB———OpenVLM
58
Qwen2.5-VL-3B
MultimodalVision-Language3.8B—8.8 GB
60
——OpenVLM
59
QTuneVL1.5-3B
MultimodalVision-Language3.8B—8.8 GB———OpenVLM
60
Ristretto-3B
MultimodalVision-Language3.8B—9.0 GB———OpenVLM
61
Mini-InternVL-Chat-4B-V1.5
MultimodalVision-Language4.0B—9.4 GB
49
——OpenVLM
62
InternVL2-4B
MultimodalVision-Language4.0B—9.4 GB
58
——OpenVLM
63
Phi-3.5-Vision
MultimodalVision-Language4.0B—9.4 GB
50
——OpenVLM
64
InternVL2.5-4B
MultimodalVision-Language4.0B—9.4 GB———OpenVLM
65
InternVL2.5-4B-MPO
MultimodalVision-Language4.0B—9.4 GB
65
——OpenVLM
66
Ovis1.6-Llama3.2-3B
MultimodalVision-Language4.1B—9.6 GB
57
——OpenVLM
67
Phi-3-Vision
MultimodalVision-Language4.2B—9.8 GB
42
——OpenVLM
68
Gemma3-4B
MultimodalVision-Language4.3B—10.1 GB
28
——OpenVLM
69
AKI-4B
MultimodalVision-Language4.3B—10.1 GB
25
——OpenVLM
70
XGen-MM-Instruct-Interleave-v1.5
MultimodalVision-Language4.4B—10.3 GB
56
——OpenVLM
71
XGen-MM-Instruct-DPO-v1.5
MultimodalVision-Language4.4B—10.3 GB
54
——OpenVLM
72
Ovis2-4B
MultimodalVision-Language4.6B—10.8 GB
84
——OpenVLM
73
R-4B
MultimodalVision-Language4.8B—11.3 GB———OpenVLM
74
ScreenAI (Google)
ui-understandingscreenshot-qascreen2words
MultimodalUI Understanding5.0B—11.7 GB——PaLI-based VLMCurated
75
Phi-4-MultiModal
MultimodalVision-Language5.6B—13.1 GB
81
——OpenVLM
76
Yi-VL-6B
MultimodalVision-Language6.6B—15.5 GB
25
——OpenVLM
77
InternLM-XComposer2
MultimodalVision-Language7.0B—16.4 GB
67
——OpenVLM
78
InternLM-XComposer2-4KHD
MultimodalVision-Language7.0B—16.4 GB
64
——OpenVLM
79
WeMM
MultimodalVision-Language7.0B—16.4 GB
61
——OpenVLM
80
Chameleon-7B
MultimodalVision-Language7.0B—16.4 GB
2
——OpenVLM
81
Slime-7B
MultimodalVision-Language7.0B—16.4 GB
18
——OpenVLM
82
MUG-U-7B
MultimodalVision-Language7.0B—16.4 GB
85
——OpenVLM
83
Ferret-UI (Apple)
ui-understandingscreenshot-analysiselement-grounding
MultimodalUI Understanding7.0B—16.4 GB
63
—Ferret + any-resolutionCurated
84
Ferret-UI 2 (Apple)
ui-understandingscreenshot-analysiselement-grounding
MultimodalUI Understanding7.0B—16.4 GB——Ferret-UI + multi-platformCurated
85
UI-TARS-7B (ByteDance)
ui-understandinggui-agentelement-grounding
MultimodalUI Understanding7.0B—16.4 GB
75
—Qwen2-VL-7B fine-tunedCurated
86
UGround (UIX-Qwen2-7B)
ui-understandingelement-grounding
MultimodalUI Understanding7.0B—16.4 GB
25
—Qwen2-VL-7B fine-tunedCurated
87
Aguvis-7B
ui-understandinggui-agentelement-grounding
MultimodalUI Understanding7.0B—16.4 GB——Qwen2-VL-7B fine-tunedCurated
88
OS-Atlas-Pro-7B
ui-understandinggui-agentelement-grounding
MultimodalUI Understanding7.0B—16.4 GB
50
—InternVL2-basedCurated
89
LLaVA-Next-Vicuna-7B
MultimodalVision-Language7.1B—16.6 GB
28
——OpenVLM
90
LLaVA-v1.5-7B (QLoRA)
MultimodalVision-Language7.2B—16.9 GB
23
——OpenVLM
91
ShareGPT4V-7B
MultimodalVision-Language7.2B—16.9 GB
22
——OpenVLM
92
LLaVA-v1.5-7B
MultimodalVision-Language7.2B—16.9 GB
20
——OpenVLM
93
LLaVA-v1-7B
MultimodalVision-Language7.2B—16.9 GB
6
——OpenVLM
94
MolmoE-1B
MultimodalVision-Language7.2B—16.9 GB
16
——OpenVLM
95
DeepSeek-VL-7B
MultimodalVision-Language7.3B—17.1 GB
43
——OpenVLM
96
Janus-Pro-7B
MultimodalVision-Language7.4B—17.4 GB
13
——OpenVLM
97
LLaVA-Next-Mistral-7B
MultimodalVision-Language7.6B—17.8 GB
29
——OpenVLM
98
LLaVA-InternLM-7B (QLoRA)
MultimodalVision-Language7.6B—17.8 GB
27
——OpenVLM
99
MMAlaya
MultimodalVision-Language7.8B—18.3 GB
10
——OpenVLM
100
InternVL3-8B
MultimodalVision-Language7.9B—18.6 GB
83
——OpenVLM
101
SAIL-VL-1.5-8B
MultimodalVision-Language8.0B—18.6 GB———OpenVLM
102
MiniCPM-Llama3-V2.5
MultimodalVision-Language8.0B—18.8 GB
53
——OpenVLM
103
IDEFICS2-8B
MultimodalVision-Language8.0B—18.8 GB
49
——OpenVLM
104
InternLM-XComposer
MultimodalVision-Language8.0B—18.8 GB
45
——OpenVLM
105
LLaVA-LLaMA-3-8B
MultimodalVision-Language8.0B—18.8 GB
35
——OpenVLM
106
ShareCaptioner
MultimodalVision-Language8.0B—18.8 GB
21
——OpenVLM
107
VisualGLM
MultimodalVision-Language8.0B—18.8 GB
4
——OpenVLM
108
InstructBLIP-7B
MultimodalVision-Language8.0B—18.8 GB
4
——OpenVLM
109
MiniGPT-4-v1-7B
MultimodalVision-Language8.0B—18.8 GB
3
——OpenVLM
110
MiniGPT-4-v2
MultimodalVision-Language8.0B—18.8 GB
1
——OpenVLM
111
InternVL2-8B
MultimodalVision-Language8.0B—18.8 GB
74
——OpenVLM
112
Cambrian-8B
MultimodalVision-Language8.0B—18.8 GB
47
——OpenVLM
113
InternLM-XComposer2.5
MultimodalVision-Language8.0B—18.8 GB
73
——OpenVLM
114
Bunny-Llama3-8B
MultimodalVision-Language8.0B—18.8 GB
57
——OpenVLM
115
Ovis1.5-Llama3-8B
MultimodalVision-Language8.0B—18.8 GB
68
——OpenVLM
116
LLaVA-Next-Llama3
MultimodalVision-Language8.0B—18.8 GB
47
——OpenVLM
117
LLaVA-Next-Interleave-7B-DPO
MultimodalVision-Language8.0B—18.8 GB
43
——OpenVLM
118
LLaVA-Next-Interleave-7B
MultimodalVision-Language8.0B—18.8 GB
47
——OpenVLM
119
Mantis-8B-clip-llama3
MultimodalVision-Language8.0B—18.8 GB
24
——OpenVLM
120
Mantis-8B-siglip-llama3
MultimodalVision-Language8.0B—18.8 GB
26
——OpenVLM
121
Mantis-8B-Idefics2
MultimodalVision-Language8.0B—18.8 GB
50
——OpenVLM
122
MiniCPM-V-2.6
MultimodalVision-Language8.0B—18.8 GB
72
——OpenVLM
123
Llama-3-MixSense-v1.1
MultimodalVision-Language8.0B—18.8 GB
51
——OpenVLM
124
Parrot-7B
MultimodalVision-Language8.0B—18.8 GB
35
——OpenVLM
125
Llama-3-VILA1.5-8B
MultimodalVision-Language8.0B—18.8 GB
13
——OpenVLM
126
Idefics3-8B-Llama3
MultimodalVision-Language8.0B—18.8 GB
52
——OpenVLM
127
Qwen2-VL-7B
MultimodalVision-Language8.0B—18.8 GB
79
——OpenVLM
128
Mantis-8B-Fuyu
MultimodalVision-Language8.0B—18.8 GB
7
——OpenVLM
129
Slime-8B
MultimodalVision-Language8.0B—18.8 GB
39
——OpenVLM
130
LLaVA-OneVision-7B
MultimodalVision-Language8.0B—18.8 GB
80
——OpenVLM
131
LLaVA-OneVision-7B (SI)
MultimodalVision-Language8.0B—18.8 GB
67
——OpenVLM
132
Molmo-7B-D
MultimodalVision-Language8.0B—18.8 GB
41
——OpenVLM
133
Molmo-7B-O
MultimodalVision-Language8.0B—18.8 GB
36
——OpenVLM
134
InternVL2-8B-MPO
MultimodalVision-Language8.0B—18.8 GB
60
——OpenVLM
135
InternVL2-8B-MPO-CoT
MultimodalVision-Language8.0B—18.8 GB
56
——OpenVLM
136
InternVL2.5-8B
MultimodalVision-Language8.0B—18.8 GB———OpenVLM
137
InternVL2.5-8B-MPO
MultimodalVision-Language8.0B—18.8 GB
85
——OpenVLM
138
LLaVA-InternLM2-7B (QLoRA)
MultimodalVision-Language8.1B—19.0 GB
40
——OpenVLM
139
mPLUG-Owl2
MultimodalVision-Language8.2B—19.2 GB
19
——OpenVLM
140
Ross-Qwen2-7B
MultimodalVision-Language8.2B—19.2 GB
67
——OpenVLM
141
Qwen2.5-VL-7B
MultimodalVision-Language8.3B—19.4 GB
80
——OpenVLM
142
WeThink-Qwen2.5VL-7B
MultimodalVision-Language8.3B—19.4 GB———OpenVLM
143
POINTS-Qwen2.5-7B
MultimodalVision-Language8.3B—19.5 GB
72
——OpenVLM
144
POINTS1.5-Qwen2.5-7B
MultimodalVision-Language8.3B—19.5 GB
79
——OpenVLM
145
VITA-1.5
MultimodalVision-Language8.3B—19.5 GB
63
——OpenVLM
146
MiMo-VL-7B
MultimodalVision-Language8.3B—19.5 GB———OpenVLM
147
SAIL-VL-1.6-8B
MultimodalVision-Language8.3B—19.5 GB———OpenVLM
148
Emu3_chat
MultimodalVision-Language8.5B—19.9 GB
15
——OpenVLM
149
MiniCPM-o-2.6
MultimodalVision-Language8.7B—20.3 GB
82
——OpenVLM
150
Ola-7b
MultimodalVision-Language8.9B—20.8 GB
97
——OpenVLM
151
valley2
MultimodalVision-Language8.9B—20.8 GB———OpenVLM
152
valley2_dpo
MultimodalVision-Language8.9B—20.8 GB———OpenVLM
153
Valley-Eagle
MultimodalVision-Language8.9B—20.9 GB———OpenVLM
154
Ovis2-8B
MultimodalVision-Language8.9B—21.0 GB
88
——OpenVLM
155
IDEFICS-9B-Instruct
MultimodalVision-Language9.0B—21.1 GB
6
——OpenVLM
156
OpenFlamingo v2
MultimodalVision-Language9.0B—21.1 GB
0
——OpenVLM
157
GLM-4v-9B
MultimodalVision-Language9.0B—21.1 GB
33
——OpenVLM
158
Eagle-X5-7B
MultimodalVision-Language9.0B—21.1 GB
31
——OpenVLM
159
InternVL3-9B
MultimodalVision-Language9.1B—21.4 GB
84
——OpenVLM
160
POINTS-Yi-1.5-9B
MultimodalVision-Language9.5B—22.3 GB
73
——OpenVLM
161
Qwen-VL-Chat
MultimodalVision-Language9.6B—22.5 GB
12
——OpenVLM
162
Qwen-VL
MultimodalVision-Language9.6B—22.5 GB
3
——OpenVLM
163
SeeClick
ui-understandingelement-groundinggui-agent
MultimodalUI Understanding9.6B—22.5 GB
0
—Qwen-VL + GUI groundingCurated
164
Monkey-Chat
MultimodalVision-Language9.8B—23.0 GB
37
——OpenVLM
165
Monkey
MultimodalVision-Language9.8B—23.0 GB
10
——OpenVLM
166
Ovis1.6-Gemma2-9B
MultimodalVision-Language10.2B—23.9 GB
82
——OpenVLM
167
Llama-3.2-11B-Vision-Instruct
MultimodalVision-Language11.0B—25.8 GB
23
——OpenVLM
168
LLaVA-CoT
MultimodalVision-Language11.0B—25.8 GB———OpenVLM
169
Ovis1.5-Gemma2-9B
MultimodalVision-Language11.4B—26.7 GB
69
——OpenVLM
170
Falcon2-VLM-11B
MultimodalVision-Language11.4B—26.7 GB
32
——OpenVLM
171
OmniLMM-12B
MultimodalVision-Language12.0B—28.1 GB
34
——OpenVLM
172
Gemma3-12B
MultimodalVision-Language12.2B—28.6 GB
52
——OpenVLM
173
XVERSE-V-13B
MultimodalVision-Language13.0B—30.5 GB
48
——OpenVLM
174
Cambrian-13B
MultimodalVision-Language13.0B—30.5 GB
40
——OpenVLM
175
OmChat-v2.0-13B
MultimodalVision-Language13.0B—30.5 GB
77
——OpenVLM
176
VILA1.5-13B
MultimodalVision-Language13.0B—30.5 GB
44
——OpenVLM
177
Slime-13B
MultimodalVision-Language13.0B—30.5 GB
17
——OpenVLM
178
Pixtral-12B
MultimodalVision-Language13.0B—30.5 GB
54
——OpenVLM
179
TransCore-M
MultimodalVision-Language13.4B—31.4 GB
76
——OpenVLM
180
LLaVA-Next-Vicuna-13B
MultimodalVision-Language13.4B—31.4 GB
30
——OpenVLM
181
ShareGPT4V-13B
MultimodalVision-Language13.4B—31.4 GB
29
——OpenVLM
182
LLaVA-v1.5-13B
MultimodalVision-Language13.4B—31.4 GB
27
——OpenVLM
183
LLaVA-v1.5-13B (QLoRA)
MultimodalVision-Language13.4B—31.4 GB
26
——OpenVLM
184
PandaGPT-13B
MultimodalVision-Language14.0B—32.8 GB
5
——OpenVLM
185
Long-VITA-16K
MultimodalVision-Language14.0B—32.8 GB———OpenVLM
186
Eagle-X5-13B
MultimodalVision-Language15.0B—35.2 GB
38
——OpenVLM
187
InternVL3-14B
MultimodalVision-Language15.1B—35.4 GB
91
——OpenVLM
188
VARCO-VISION-14B
MultimodalVision-Language15.2B—35.6 GB
89
——OpenVLM
189
VARCO-VISION-2.0-14B
MultimodalVision-Language15.2B—35.6 GB———OpenVLM
190
DeepSeek-VL2-Small
MultimodalVision-Language16.1B—37.7 GB
78
——OpenVLM
191
Ovis2-16B
MultimodalVision-Language16.2B—38.0 GB
96
——OpenVLM
192
Kimi-VL-A3B-Instruct
MultimodalVision-Language16.4B—38.4 GB
74
——OpenVLM
193
Kimi-VL-A3B-Thinking
MultimodalVision-Language16.4B—38.4 GB———OpenVLM
194
Kimi-VL-A3B-Thinking-2506
MultimodalVision-Language16.4B—38.4 GB———OpenVLM
195
CogVLM-17B-Chat
MultimodalVision-Language17.0B—39.8 GB
19
——OpenVLM
196
bailingMM-mini
MultimodalVision-Language17.0B—39.8 GB———OpenVLM
197
CogAgent
ui-understandinggui-agentscreenshot-analysis
MultimodalUI Understanding18.0B—42.2 GB——CogVLM + high-res cross-moduleCurated
198
CogVLM2-19B-Chat
MultimodalVision-Language19.0B—44.5 GB
44
——OpenVLM
199
LLaVA-InternLM2-20B (QLoRA)
MultimodalVision-Language20.2B—47.3 GB
48
——OpenVLM
200
BailingMM-Lite-1203
MultimodalVision-Language21.0B—49.2 GB
86
——OpenVLM
201
Aria
MultimodalVision-Language25.3B—59.3 GB
63
——OpenVLM
202
InternVL-Chat-V1.5
MultimodalVision-Language26.0B—60.9 GB
76
——OpenVLM
203
InternVL2-26B
MultimodalVision-Language26.0B—60.9 GB
83
——OpenVLM
204
MMAlaya2
MultimodalVision-Language26.0B—60.9 GB
77
——OpenVLM
205
InternVL2.5-26B
MultimodalVision-Language26.0B—60.9 GB———OpenVLM
206
InternVL2.5-26B-MPO
MultimodalVision-Language26.0B—60.9 GB
90
——OpenVLM
207
Gemma3-27B
MultimodalVision-Language27.4B—64.2 GB
75
——OpenVLM
208
DeepSeek-VL2
MultimodalVision-Language27.5B—64.5 GB
86
——OpenVLM
209
Ovis1.6-Gemma2-27B
MultimodalVision-Language28.9B—67.7 GB
89
——OpenVLM
210
Chameleon-30B
MultimodalVision-Language30.0B—70.3 GB
3
——OpenVLM
211
KoreaDeep-VLM-OCR-32B
MultimodalVision-Language32.0B—75.0 GB———OpenVLM
212
LLaVA-Next-Qwen-32B
MultimodalVision-Language33.0B—77.3 GB
62
——OpenVLM
213
Qwen2.5-VL-32B
MultimodalVision-Language33.5B—78.5 GB———OpenVLM
214
Cambrian-34B
MultimodalVision-Language34.0B—79.7 GB
66
——OpenVLM
215
Yi-VL-34B
MultimodalVision-Language34.6B—81.1 GB
38
——OpenVLM
216
LLaVA-Next-Yi-34B
MultimodalVision-Language34.8B—81.6 GB
70
——OpenVLM
217
Ovis2-34B
MultimodalVision-Language34.9B—81.8 GB
97
——OpenVLM
218
Eagle-X5-34B-Chat
MultimodalVision-Language36.8B—86.3 GB
64
——OpenVLM
219
Emu2_chat
MultimodalVision-Language37.0B—86.7 GB
14
——OpenVLM
220
InternVL2.5-38B
MultimodalVision-Language38.0B—89.1 GB———OpenVLM
221
InternVL2.5-38B-MPO
MultimodalVision-Language38.0B—89.1 GB
92
——OpenVLM
222
InternVL3-38B
MultimodalVision-Language38.4B—90.0 GB
97
——OpenVLM
223
InternVL2-40B
MultimodalVision-Language40.0B—93.8 GB
94
——OpenVLM
224
VILA1.5-40B
MultimodalVision-Language40.0B—93.8 GB
73
——OpenVLM
225
VITA
MultimodalVision-Language47.0B—110.2 GB———OpenVLM
226
360VL-70B
MultimodalVision-Language70.0B—164.1 GB
59
——OpenVLM
227
Qwen-VL-Max-0809
MultimodalVision-Language72.0B—168.8 GB
93
——OpenVLM
228
UI-TARS-72B (ByteDance)
ui-understandinggui-agentelement-grounding
MultimodalUI Understanding72.0B—168.8 GB
88
—Qwen2-VL-72B fine-tunedCurated
229
LLaVA-OneVision-72B (SI)
MultimodalVision-Language73.0B—171.1 GB———OpenVLM
230
LLaVA-OneVision-72B
MultimodalVision-Language73.0B—171.1 GB
91
——OpenVLM
231
Molmo-72B
MultimodalVision-Language73.3B—171.8 GB———OpenVLM
232
Qwen2-VL-72B
MultimodalVision-Language73.4B—172.0 GB
95
——OpenVLM
233
Qwen2.5-VL-72B
MultimodalVision-Language73.4B—172.0 GB
98
——OpenVLM
234
InternVL2-Llama3-76B
MultimodalVision-Language76.0B—178.1 GB
93
——OpenVLM
235
InternVL2.5-78B
MultimodalVision-Language78.0B—182.8 GB
98
——OpenVLM
236
InternVL2.5-78B-MPO
MultimodalVision-Language78.0B—182.8 GB
99
——OpenVLM
237
InternVL3-78B
MultimodalVision-Language78.4B—183.8 GB
100
——OpenVLM
238
RBDash-v1.5
MultimodalVision-Language79.0B—185.2 GB
88
——OpenVLM
239
NVLM-D-72B
MultimodalVision-Language79.4B—186.1 GB
65
——OpenVLM
240
IDEFICS-80B-Instruct
MultimodalVision-Language80.0B—187.5 GB
9
——OpenVLM
241
BailingMM-Pro-0120
MultimodalVision-Language81.0B—189.8 GB
96
——OpenVLM
242
Llama-3.2-90B-Vision-Instruct
MultimodalVision-Language88.6B—207.7 GB
66
——OpenVLM
243
GPT-4o (0513, detail-high)
MultimodalVision-Language———
83
——OpenVLM
244
GPT-4o (0513, detail-low)
MultimodalVision-Language———
81
——OpenVLM
245
GLM-4v
MultimodalVision-Language———
70
——OpenVLM
246
GPT-4v (0409, detail-high)
MultimodalVision-Language———
70
——OpenVLM
247
GPT-4v (0409, detail-low)
MultimodalVision-Language———
69
——OpenVLM
248
Qwen-VL-Max
MultimodalVision-Language———
53
——OpenVLM
249
GPT-4v (1106, detail-low)
MultimodalVision-Language———
51
——OpenVLM
250
RekaFlash
MultimodalVision-Language———
50
——OpenVLM
251
Gemini-1.0-Pro
MultimodalVision-Language———
42
——OpenVLM
252
Claude3-Sonnet
MultimodalVision-Language———
23
——OpenVLM
253
Qwen-VL-Plus
MultimodalVision-Language———
21
——OpenVLM
254
RekaEdge
MultimodalVision-Language———
20
——OpenVLM
255
GPT-4v (1106, detail-high)
MultimodalVision-Language———
18
——OpenVLM
256
Claude3-Opus
MultimodalVision-Language———
14
——OpenVLM
257
Claude3-Haiku
MultimodalVision-Language———
11
——OpenVLM
258
Gemini-1.5-Pro
MultimodalVision-Language———
43
——OpenVLM
259
Claude3.5-Sonnet
MultimodalVision-Language———
63
——OpenVLM
260
CongRong
MultimodalVision-Language———
80
——OpenVLM
261
GPT-4o-mini (0718, detail-high)
MultimodalVision-Language———
53
——OpenVLM
262
Yi-Vision
MultimodalVision-Language———
55
——OpenVLM
263
GPT-4o (0806, detail-high)
MultimodalVision-Language———
75
——OpenVLM
264
Step-1.5V
MultimodalVision-Language———
90
——OpenVLM
265
Gemini-1.5-Flash
MultimodalVision-Language———
62
——OpenVLM
266
Qwen-VL-Plus-0809
MultimodalVision-Language———
78
——OpenVLM
267
Claude3.5-Sonnet-20241022
MultimodalVision-Language———
77
——OpenVLM
268
Taiyi
MultimodalVision-Language———
93
——OpenVLM
269
JT-VL-Chat-V3.0
MultimodalVision-Language——————OpenVLM
270
TeleMM
MultimodalVision-Language——————OpenVLM
271
Gemini-1.5-Pro-002
MultimodalVision-Language——————OpenVLM
272
Gemini-1.5-Flash-002
MultimodalVision-Language——————OpenVLM
273
GPT-4o (1120, detail-high)
MultimodalVision-Language——————OpenVLM
274
GLM-4v-Plus
MultimodalVision-Language———
71
——OpenVLM
275
Step-1.5V-mini
MultimodalVision-Language———
2
——OpenVLM
276
abab6.5s
MultimodalVision-Language———
11
——OpenVLM
277
abab7-preview
MultimodalVision-Language———
87
——OpenVLM
278
SenseNova
MultimodalVision-Language——————OpenVLM
279
Gemini-2.0-Flash
MultimodalVision-Language——————OpenVLM
280
Step-1o
MultimodalVision-Language———
99
——OpenVLM
281
HunYuan-Standard-Vision
MultimodalVision-Language———
92
——OpenVLM
282
GLM-4v-Plus-20250111
MultimodalVision-Language———
100
——OpenVLM
283
Gemini-2.0-Pro
MultimodalVision-Language———
87
——OpenVLM
284
Claude3.7-Sonnet
MultimodalVision-Language———
71
——OpenVLM
285
moonshot-v1-8k
MultimodalVision-Language———
61
——OpenVLM
286
grok-2-vision-1212
MultimodalVision-Language———
90
——OpenVLM
287
GPT-4.5
MultimodalVision-Language——————OpenVLM
288
ChatGPT-4o-latest
MultimodalVision-Language——————OpenVLM
289
Gemini-2.5-Pro
MultimodalVision-Language——————OpenVLM
290
GPT-4.1-20250414
MultimodalVision-Language———
95
——OpenVLM
291
GPT-4.1-mini-20250414
MultimodalVision-Language———
94
——OpenVLM
292
GPT-4.1-nano-20250414
MultimodalVision-Language———
24
——OpenVLM
293
SenseNova-V6-Pro
MultimodalVision-Language——————OpenVLM
294
CongRong-v2.0
MultimodalVision-Language——————OpenVLM
295
GPT-5-20250807
MultimodalVision-Language——————OpenVLM
296
GPT-5-nano-20250807
MultimodalVision-Language——————OpenVLM
297
GPT-5-mini-20250807
MultimodalVision-Language——————OpenVLM
298
SenseNova-V6-5-Pro
MultimodalVision-Language——————OpenVLM
299
EasyOCR
Multimodalimage to text——————Qualcomm AI Hub
300
GR00TN1.5
Multimodalrobotics——————Qualcomm AI Hub
301
Pi0.5
Multimodalrobotics——————Qualcomm AI Hub
302
SigLIP2
MultimodalImage Classification——————Qualcomm AI Hub
303
TrOCR
Multimodalimage to text——————Qualcomm AI Hub
304
OmniParser (Microsoft)
ui-understandingscreenshot-parsingelement-detection
MultimodalUI Understanding———
100
—Detection + OCR + Icon pipelineCurated
305
OmniParser V2 (Microsoft)
ui-understandingscreenshot-parsingelement-detection
MultimodalUI Understanding—————Detection + OCR + Icon pipeline v2Curated