Domain
Task
Showing 285 models
| # | Model | Domain | Task | Params ↑ | GFLOPs | VRAM | Score | Speed | Arch | Source |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | SmolVLM-256M | Multimodal | Vision-Language | 260.0M | — | 624 MB | 41.7MMBench | — | — | OpenVLM |
| 2 | SmolVLM2-256M | Multimodal | Vision-Language | 260.0M | — | 624 MB | 11.9MMBench | — | — | OpenVLM |
| 3 | SmolVLM-500M | Multimodal | Vision-Language | 510.0M | — | 1.2 GB | 53.8MMBench | — | — | OpenVLM |
| 4 | SmolVLM2-500M | Multimodal | Vision-Language | 510.0M | — | 1.2 GB | 53.1MMBench | — | — | OpenVLM |
| 5 | H2OVL-800M | Multimodal | Vision-Language | 830.0M | — | 1.9 GB | 56.3MMBench | — | — | OpenVLM |
| 6 | InternVL3-1B | Multimodal | Vision-Language | 940.0M | — | 2.2 GB | 72.3MMBench | — | — | OpenVLM |
| 7 | InternVL2-1B | Multimodal | Vision-Language | 1.0B | — | 2.3 GB | 65.2MMBench | — | — | OpenVLM |
| 8 | LLaVA-OneVision-0.5B | Multimodal | Vision-Language | 1.0B | — | 2.3 GB | 61.6MMBench | — | — | OpenVLM |
| 9 | LLaVA-OneVision-0.5B (SI) | Multimodal | Vision-Language | 1.0B | — | 2.3 GB | 55.8MMBench | — | — | OpenVLM |
| 10 | InternVL2.5-1B | Multimodal | Vision-Language | 1.0B | — | 2.3 GB | —— | — | — | OpenVLM |
| 11 | InternVL2.5-1B-MPO | Multimodal | Vision-Language | 1.0B | — | 2.3 GB | 70.1MMBench | — | — | OpenVLM |
| 12 | Ovis2-1B | Multimodal | Vision-Language | 1.3B | — | 3.0 GB | 71.6MMBench | — | — | OpenVLM |
| 13 | Kosmos2 | Multimodal | Vision-Language | 1.7B | — | 4.0 GB | 1.1MMBench | — | — | OpenVLM |
| 14 | Moondream1 | Multimodal | Vision-Language | 1.9B | — | 4.5 GB | 62.3MMBench | — | — | OpenVLM |
| 15 | Moondream2 | Multimodal | Vision-Language | 1.9B | — | 4.5 GB | 70.0MMBench | — | — | OpenVLM |
| 16 | InternLM-XComposer2-1.8B | Multimodal | Vision-Language | 2.0B | — | 4.7 GB | 73.0MMBench | — | — | OpenVLM |
| 17 | DeepSeek-VL-1.3B | Multimodal | Vision-Language | 2.0B | — | 4.7 GB | 66.4MMBench | — | — | OpenVLM |
| 18 | Mini-InternVL-Chat-2B-V1.5 | Multimodal | Vision-Language | 2.0B | — | 4.7 GB | 70.7MMBench | — | — | OpenVLM |
| 19 | InternVL2-2B | Multimodal | Vision-Language | 2.0B | — | 4.7 GB | 73.4MMBench | — | — | OpenVLM |
| 20 | Qwen2-VL-2B | Multimodal | Vision-Language | 2.0B | — | 4.7 GB | 74.6MMBench | — | — | OpenVLM |
| 21 | XinYuan-VL-2B-Instruct | Multimodal | Vision-Language | 2.0B | — | 4.7 GB | 78.4MMBench | — | — | OpenVLM |
| 22 | InternVL2.5-2B | Multimodal | Vision-Language | 2.0B | — | 4.7 GB | —— | — | — | OpenVLM |
| 23 | InternVL2.5-2B-MPO | Multimodal | Vision-Language | 2.0B | — | 4.7 GB | 74.5MMBench | — | — | OpenVLM |
| 24 | InternVL3-2B | Multimodal | Vision-Language | 2.1B | — | 4.9 GB | 80.8MMBench | — | — | OpenVLM |
| 25 | QTuneVL1.5-2B | Multimodal | Vision-Language | 2.1B | — | 4.9 GB | —— | — | — | OpenVLM |
| 26 | Janus-1.3B | Multimodal | Vision-Language | 2.1B | — | 4.9 GB | 52.0MMBench | — | — | OpenVLM |
| 27 | SAIL-VL-2B | Multimodal | Vision-Language | 2.1B | — | 4.9 GB | 79.0MMBench | — | — | OpenVLM |
| 28 | VARCO-VISION-2.0-1.7B | Multimodal | Vision-Language | 2.1B | — | 5.0 GB | —— | — | — | OpenVLM |
| 29 | MiniMonkey | Multimodal | Vision-Language | 2.2B | — | 5.2 GB | 72.4MMBench | — | — | OpenVLM |
| 30 | Aquila-VL-2B | Multimodal | Vision-Language | 2.2B | — | 5.2 GB | 79.0MMBench | — | — | OpenVLM |
| 31 | H2OVL-2B | Multimodal | Vision-Language | 2.2B | — | 5.2 GB | 72.1MMBench | — | — | OpenVLM |
| 32 | QTuneVL1-2B | Multimodal | Vision-Language | 2.2B | — | 5.2 GB | —— | — | — | OpenVLM |
| 33 | SmolVLM2 | Multimodal | Vision-Language | 2.3B | — | 5.3 GB | 71.4MMBench | — | — | OpenVLM |
| 34 | SmolVLM-Instruct | Multimodal | Vision-Language | 2.3B | — | 5.4 GB | 67.5MMBench | — | — | OpenVLM |
| 35 | SmolVLM-Instruct-DPO | Multimodal | Vision-Language | 2.3B | — | 5.4 GB | 65.0MMBench | — | — | OpenVLM |
| 36 | SmolVLM-Synthetic | Multimodal | Vision-Language | 2.3B | — | 5.4 GB | 53.7MMBench | — | — | OpenVLM |
| 37 | HawkVL-2B | Multimodal | Vision-Language | 2.4B | — | 5.7 GB | —— | — | — | OpenVLM |
| 38 | Ovis2-2B | Multimodal | Vision-Language | 2.5B | — | 5.8 GB | 78.6MMBench | — | — | OpenVLM |
| 39 | SAIL-VL-1.5-2B | Multimodal | Vision-Language | 2.5B | — | 5.8 GB | —— | — | — | OpenVLM |
| 40 | Flash-VL-2B-Dynamic-ISS | Multimodal | Vision-Language | 2.5B | — | 5.9 GB | —— | — | — | OpenVLM |
| 41 | MiniCPM-V-2 | Multimodal | Vision-Language | 2.8B | — | 6.6 GB | 69.1MMBench | — | — | OpenVLM |
| 42 | BlueLM-2.5-3B | Multimodal | Vision-Language | 2.9B | — | 6.8 GB | —— | — | — | OpenVLM |
| 43 | granite-vision-3.1-2b-preview | Multimodal | Vision-Language | 3.0B | — | 7.0 GB | —— | — | — | OpenVLM |
| 44 | granite-vision-3.2-2b | Multimodal | Vision-Language | 3.0B | — | 7.0 GB | 78.1MMBench | — | — | OpenVLM |
| 45 | granite-vision-3.3-2b | Multimodal | Vision-Language | 3.0B | — | 7.0 GB | 73.5MMBench | — | — | OpenVLM |
| 46 | PaliGemma-3B-mix-448 | Multimodal | Vision-Language | 3.0B | — | 7.0 GB | 71.0MMBench | — | — | OpenVLM |
| 47 | MiniCPM-V | Multimodal | Vision-Language | 3.0B | — | 7.0 GB | 64.1MMBench | — | — | OpenVLM |
| 48 | VILA1.5-3B | Multimodal | Vision-Language | 3.0B | — | 7.0 GB | 64.5MMBench | — | — | OpenVLM |
| 49 | BlueLM-V-3B | Multimodal | Vision-Language | 3.0B | — | 7.0 GB | 84.1MMBench | — | — | OpenVLM |
| 50 | BlueLM-2.6-3B | Multimodal | Vision-Language | 3.0B | — | 7.0 GB | —— | — | — | OpenVLM |
| 51 | DeepSeek-VL2-Tiny | Multimodal | Vision-Language | 3.4B | — | 8.0 GB | 74.6MMBench | — | — | OpenVLM |
| 52 | Ovis-U1-3B | Multimodal | Vision-Language | 3.6B | — | 8.5 GB | —— | — | — | OpenVLM |
| 53 | Vintern-3B-beta | Multimodal | Vision-Language | 3.7B | — | 8.7 GB | 70.6MMBench | — | — | OpenVLM |
| 54 | Vintern-1B-v2 | Multimodal | Vision-Language | 3.7B | — | 8.7 GB | —— | — | — | OpenVLM |
| 55 | Qwen2.5-VL-3B | Multimodal | Vision-Language | 3.8B | — | 8.8 GB | 79.1MMBench | — | — | OpenVLM |
| 56 | QTuneVL1.5-3B | Multimodal | Vision-Language | 3.8B | — | 8.8 GB | —— | — | — | OpenVLM |
| 57 | Ristretto-3B | Multimodal | Vision-Language | 3.8B | — | 9.0 GB | —— | — | — | OpenVLM |
| 58 | Mini-InternVL-Chat-4B-V1.5 | Multimodal | Vision-Language | 4.0B | — | 9.4 GB | 75.7MMBench | — | — | OpenVLM |
| 59 | InternVL2-4B | Multimodal | Vision-Language | 4.0B | — | 9.4 GB | 78.5MMBench | — | — | OpenVLM |
| 60 | Phi-3.5-Vision | Multimodal | Vision-Language | 4.0B | — | 9.4 GB | 76.0MMBench | — | — | OpenVLM |
| 61 | InternVL2.5-4B | Multimodal | Vision-Language | 4.0B | — | 9.4 GB | —— | — | — | OpenVLM |
| 62 | InternVL2.5-4B-MPO | Multimodal | Vision-Language | 4.0B | — | 9.4 GB | 80.4MMBench | — | — | OpenVLM |
| 63 | Ovis1.6-Llama3.2-3B | Multimodal | Vision-Language | 4.1B | — | 9.6 GB | 78.5MMBench | — | — | OpenVLM |
| 64 | Phi-3-Vision | Multimodal | Vision-Language | 4.2B | — | 9.8 GB | 73.6MMBench | — | — | OpenVLM |
| 65 | Gemma3-4B | Multimodal | Vision-Language | 4.3B | — | 10.1 GB | 69.6MMBench | — | — | OpenVLM |
| 66 | AKI-4B | Multimodal | Vision-Language | 4.3B | — | 10.1 GB | 68.8MMBench | — | — | OpenVLM |
| 67 | XGen-MM-Instruct-Interleave-v1.5 | Multimodal | Vision-Language | 4.4B | — | 10.3 GB | 78.3MMBench | — | — | OpenVLM |
| 68 | XGen-MM-Instruct-DPO-v1.5 | Multimodal | Vision-Language | 4.4B | — | 10.3 GB | 78.0MMBench | — | — | OpenVLM |
| 69 | Ovis2-4B | Multimodal | Vision-Language | 4.6B | — | 10.8 GB | 83.6MMBench | — | — | OpenVLM |
| 70 | R-4B | Multimodal | Vision-Language | 4.8B | — | 11.3 GB | —— | — | — | OpenVLM |
| 71 | Phi-4-MultiModal | Multimodal | Vision-Language | 5.6B | — | 13.1 GB | 83.4MMBench | — | — | OpenVLM |
| 72 | Yi-VL-6B | Multimodal | Vision-Language | 6.6B | — | 15.5 GB | 68.4MMBench | — | — | OpenVLM |
| 73 | InternLM-XComposer2 | Multimodal | Vision-Language | 7.0B | — | 16.4 GB | 80.7MMBench | — | — | OpenVLM |
| 74 | InternLM-XComposer2-4KHD | Multimodal | Vision-Language | 7.0B | — | 16.4 GB | 80.2MMBench | — | — | OpenVLM |
| 75 | WeMM | Multimodal | Vision-Language | 7.0B | — | 16.4 GB | 79.3MMBench | — | — | OpenVLM |
| 76 | Chameleon-7B | Multimodal | Vision-Language | 7.0B | — | 16.4 GB | 15.4MMBench | — | — | OpenVLM |
| 77 | Slime-7B | Multimodal | Vision-Language | 7.0B | — | 16.4 GB | 65.8MMBench | — | — | OpenVLM |
| 78 | MUG-U-7B | Multimodal | Vision-Language | 7.0B | — | 16.4 GB | 83.9MMBench | — | — | OpenVLM |
| 79 | LLaVA-Next-Vicuna-7B | Multimodal | Vision-Language | 7.1B | — | 16.6 GB | 69.2MMBench | — | — | OpenVLM |
| 80 | LLaVA-v1.5-7B (QLoRA) | Multimodal | Vision-Language | 7.2B | — | 16.9 GB | 67.7MMBench | — | — | OpenVLM |
| 81 | ShareGPT4V-7B | Multimodal | Vision-Language | 7.2B | — | 16.9 GB | 67.6MMBench | — | — | OpenVLM |
| 82 | LLaVA-v1.5-7B | Multimodal | Vision-Language | 7.2B | — | 16.9 GB | 66.5MMBench | — | — | OpenVLM |
| 83 | LLaVA-v1-7B | Multimodal | Vision-Language | 7.2B | — | 16.9 GB | 43.8MMBench | — | — | OpenVLM |
| 84 | MolmoE-1B | Multimodal | Vision-Language | 7.2B | — | 16.9 GB | 64.6MMBench | — | — | OpenVLM |
| 85 | DeepSeek-VL-7B | Multimodal | Vision-Language | 7.3B | — | 17.1 GB | 73.8MMBench | — | — | OpenVLM |
| 86 | Janus-Pro-7B | Multimodal | Vision-Language | 7.4B | — | 17.4 GB | 62.6MMBench | — | — | OpenVLM |
| 87 | LLaVA-Next-Mistral-7B | Multimodal | Vision-Language | 7.6B | — | 17.8 GB | 69.6MMBench | — | — | OpenVLM |
| 88 | LLaVA-InternLM-7B (QLoRA) | Multimodal | Vision-Language | 7.6B | — | 17.8 GB | 69.0MMBench | — | — | OpenVLM |
| 89 | MMAlaya | Multimodal | Vision-Language | 7.8B | — | 18.3 GB | 58.7MMBench | — | — | OpenVLM |
| 90 | InternVL3-8B | Multimodal | Vision-Language | 7.9B | — | 18.6 GB | 83.6MMBench | — | — | OpenVLM |
| 91 | SAIL-VL-1.5-8B | Multimodal | Vision-Language | 8.0B | — | 18.6 GB | —— | — | — | OpenVLM |
| 92 | MiniCPM-Llama3-V2.5 | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 77.6MMBench | — | — | OpenVLM |
| 93 | IDEFICS2-8B | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 75.7MMBench | — | — | OpenVLM |
| 94 | InternLM-XComposer | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 74.4MMBench | — | — | OpenVLM |
| 95 | LLaVA-LLaMA-3-8B | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 71.7MMBench | — | — | OpenVLM |
| 96 | ShareCaptioner | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 66.5MMBench | — | — | OpenVLM |
| 97 | VisualGLM | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 37.6MMBench | — | — | OpenVLM |
| 98 | InstructBLIP-7B | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 33.9MMBench | — | — | OpenVLM |
| 99 | MiniGPT-4-v1-7B | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 23.0MMBench | — | — | OpenVLM |
| 100 | MiniGPT-4-v2 | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 9.4MMBench | — | — | OpenVLM |
| 101 | InternVL2-8B | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 82.0MMBench | — | — | OpenVLM |
| 102 | Cambrian-8B | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 74.6MMBench | — | — | OpenVLM |
| 103 | InternLM-XComposer2.5 | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 82.0MMBench | — | — | OpenVLM |
| 104 | Bunny-Llama3-8B | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 78.3MMBench | — | — | OpenVLM |
| 105 | Ovis1.5-Llama3-8B | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 80.8MMBench | — | — | OpenVLM |
| 106 | LLaVA-Next-Llama3 | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 74.8MMBench | — | — | OpenVLM |
| 107 | LLaVA-Next-Interleave-7B-DPO | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 73.8MMBench | — | — | OpenVLM |
| 108 | LLaVA-Next-Interleave-7B | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 74.7MMBench | — | — | OpenVLM |
| 109 | Mantis-8B-clip-llama3 | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 68.2MMBench | — | — | OpenVLM |
| 110 | Mantis-8B-siglip-llama3 | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 69.0MMBench | — | — | OpenVLM |
| 111 | Mantis-8B-Idefics2 | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 76.0MMBench | — | — | OpenVLM |
| 112 | MiniCPM-V-2.6 | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 81.5MMBench | — | — | OpenVLM |
| 113 | Llama-3-MixSense-v1.1 | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 77.0MMBench | — | — | OpenVLM |
| 114 | Parrot-7B | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 72.0MMBench | — | — | OpenVLM |
| 115 | Llama-3-VILA1.5-8B | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 62.1MMBench | — | — | OpenVLM |
| 116 | Idefics3-8B-Llama3 | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 77.5MMBench | — | — | OpenVLM |
| 117 | Qwen2-VL-7B | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 82.8MMBench | — | — | OpenVLM |
| 118 | Mantis-8B-Fuyu | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 46.6MMBench | — | — | OpenVLM |
| 119 | Slime-8B | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 72.8MMBench | — | — | OpenVLM |
| 120 | LLaVA-OneVision-7B | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 83.2MMBench | — | — | OpenVLM |
| 121 | LLaVA-OneVision-7B (SI) | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 80.5MMBench | — | — | OpenVLM |
| 122 | Molmo-7B-D | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 73.6MMBench | — | — | OpenVLM |
| 123 | Molmo-7B-O | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 72.2MMBench | — | — | OpenVLM |
| 124 | InternVL2-8B-MPO | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 79.2MMBench | — | — | OpenVLM |
| 125 | InternVL2-8B-MPO-CoT | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 78.3MMBench | — | — | OpenVLM |
| 126 | InternVL2.5-8B | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | —— | — | — | OpenVLM |
| 127 | InternVL2.5-8B-MPO | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 83.9MMBench | — | — | OpenVLM |
| 128 | LLaVA-InternLM2-7B (QLoRA) | Multimodal | Vision-Language | 8.1B | — | 19.0 GB | 73.3MMBench | — | — | OpenVLM |
| 129 | mPLUG-Owl2 | Multimodal | Vision-Language | 8.2B | — | 19.2 GB | 66.0MMBench | — | — | OpenVLM |
| 130 | Ross-Qwen2-7B | Multimodal | Vision-Language | 8.2B | — | 19.2 GB | 80.5MMBench | — | — | OpenVLM |
| 131 | Qwen2.5-VL-7B | Multimodal | Vision-Language | 8.3B | — | 19.4 GB | 83.2MMBench | — | — | OpenVLM |
| 132 | WeThink-Qwen2.5VL-7B | Multimodal | Vision-Language | 8.3B | — | 19.4 GB | —— | — | — | OpenVLM |
| 133 | POINTS-Qwen2.5-7B | Multimodal | Vision-Language | 8.3B | — | 19.5 GB | 81.4MMBench | — | — | OpenVLM |
| 134 | POINTS1.5-Qwen2.5-7B | Multimodal | Vision-Language | 8.3B | — | 19.5 GB | 82.8MMBench | — | — | OpenVLM |
| 135 | VITA-1.5 | Multimodal | Vision-Language | 8.3B | — | 19.5 GB | 79.8MMBench | — | — | OpenVLM |
| 136 | MiMo-VL-7B | Multimodal | Vision-Language | 8.3B | — | 19.5 GB | —— | — | — | OpenVLM |
| 137 | SAIL-VL-1.6-8B | Multimodal | Vision-Language | 8.3B | — | 19.5 GB | —— | — | — | OpenVLM |
| 138 | Emu3_chat | Multimodal | Vision-Language | 8.5B | — | 19.9 GB | 63.8MMBench | — | — | OpenVLM |
| 139 | MiniCPM-o-2.6 | Multimodal | Vision-Language | 8.7B | — | 20.3 GB | 83.4MMBench | — | — | OpenVLM |
| 140 | Ola-7b | Multimodal | Vision-Language | 8.9B | — | 20.8 GB | 87.4MMBench | — | — | OpenVLM |
| 141 | valley2 | Multimodal | Vision-Language | 8.9B | — | 20.8 GB | —— | — | — | OpenVLM |
| 142 | valley2_dpo | Multimodal | Vision-Language | 8.9B | — | 20.8 GB | —— | — | — | OpenVLM |
| 143 | Valley-Eagle | Multimodal | Vision-Language | 8.9B | — | 20.9 GB | —— | — | — | OpenVLM |
| 144 | Ovis2-8B | Multimodal | Vision-Language | 8.9B | — | 21.0 GB | 84.8MMBench | — | — | OpenVLM |
| 145 | IDEFICS-9B-Instruct | Multimodal | Vision-Language | 9.0B | — | 21.1 GB | 45.3MMBench | — | — | OpenVLM |
| 146 | OpenFlamingo v2 | Multimodal | Vision-Language | 9.0B | — | 21.1 GB | 5.7MMBench | — | — | OpenVLM |
| 147 | GLM-4v-9B | Multimodal | Vision-Language | 9.0B | — | 21.1 GB | 71.4MMBench | — | — | OpenVLM |
| 148 | Eagle-X5-7B | Multimodal | Vision-Language | 9.0B | — | 21.1 GB | 70.1MMBench | — | — | OpenVLM |
| 149 | InternVL3-9B | Multimodal | Vision-Language | 9.1B | — | 21.4 GB | 83.9MMBench | — | — | OpenVLM |
| 150 | POINTS-Yi-1.5-9B | Multimodal | Vision-Language | 9.5B | — | 22.3 GB | 81.6MMBench | — | — | OpenVLM |
| 151 | Qwen-VL-Chat | Multimodal | Vision-Language | 9.6B | — | 22.5 GB | 61.8MMBench | — | — | OpenVLM |
| 152 | Qwen-VL | Multimodal | Vision-Language | 9.6B | — | 22.5 GB | 32.2MMBench | — | — | OpenVLM |
| 153 | Monkey-Chat | Multimodal | Vision-Language | 9.8B | — | 23.0 GB | 72.4MMBench | — | — | OpenVLM |
| 154 | Monkey | Multimodal | Vision-Language | 9.8B | — | 23.0 GB | 59.6MMBench | — | — | OpenVLM |
| 155 | Ovis1.6-Gemma2-9B | Multimodal | Vision-Language | 10.2B | — | 23.9 GB | 83.4MMBench | — | — | OpenVLM |
| 156 | Llama-3.2-11B-Vision-Instruct | Multimodal | Vision-Language | 11.0B | — | 25.8 GB | 68.0MMBench | — | — | OpenVLM |
| 157 | LLaVA-CoT | Multimodal | Vision-Language | 11.0B | — | 25.8 GB | —— | — | — | OpenVLM |
| 158 | Ovis1.5-Gemma2-9B | Multimodal | Vision-Language | 11.4B | — | 26.7 GB | 80.9MMBench | — | — | OpenVLM |
| 159 | Falcon2-VLM-11B | Multimodal | Vision-Language | 11.4B | — | 26.7 GB | 70.7MMBench | — | — | OpenVLM |
| 160 | OmniLMM-12B | Multimodal | Vision-Language | 12.0B | — | 28.1 GB | 71.7MMBench | — | — | OpenVLM |
| 161 | Gemma3-12B | Multimodal | Vision-Language | 12.2B | — | 28.6 GB | 77.5MMBench | — | — | OpenVLM |
| 162 | XVERSE-V-13B | Multimodal | Vision-Language | 13.0B | — | 30.5 GB | 75.4MMBench | — | — | OpenVLM |
| 163 | Cambrian-13B | Multimodal | Vision-Language | 13.0B | — | 30.5 GB | 73.2MMBench | — | — | OpenVLM |
| 164 | OmChat-v2.0-13B | Multimodal | Vision-Language | 13.0B | — | 30.5 GB | 82.6MMBench | — | — | OpenVLM |
| 165 | VILA1.5-13B | Multimodal | Vision-Language | 13.0B | — | 30.5 GB | 74.4MMBench | — | — | OpenVLM |
| 166 | Slime-13B | Multimodal | Vision-Language | 13.0B | — | 30.5 GB | 65.4MMBench | — | — | OpenVLM |
| 167 | Pixtral-12B | Multimodal | Vision-Language | 13.0B | — | 30.5 GB | 77.9MMBench | — | — | OpenVLM |
| 168 | TransCore-M | Multimodal | Vision-Language | 13.4B | — | 31.4 GB | 82.3MMBench | — | — | OpenVLM |
| 169 | LLaVA-Next-Vicuna-13B | Multimodal | Vision-Language | 13.4B | — | 31.4 GB | 70.0MMBench | — | — | OpenVLM |
| 170 | ShareGPT4V-13B | Multimodal | Vision-Language | 13.4B | — | 31.4 GB | 69.8MMBench | — | — | OpenVLM |
| 171 | LLaVA-v1.5-13B | Multimodal | Vision-Language | 13.4B | — | 31.4 GB | 69.2MMBench | — | — | OpenVLM |
| 172 | LLaVA-v1.5-13B (QLoRA) | Multimodal | Vision-Language | 13.4B | — | 31.4 GB | 68.8MMBench | — | — | OpenVLM |
| 173 | PandaGPT-13B | Multimodal | Vision-Language | 14.0B | — | 32.8 GB | 42.5MMBench | — | — | OpenVLM |
| 174 | Long-VITA-16K | Multimodal | Vision-Language | 14.0B | — | 32.8 GB | —— | — | — | OpenVLM |
| 175 | Eagle-X5-13B | Multimodal | Vision-Language | 15.0B | — | 35.2 GB | 72.6MMBench | — | — | OpenVLM |
| 176 | InternVL3-14B | Multimodal | Vision-Language | 15.1B | — | 35.4 GB | 85.7MMBench | — | — | OpenVLM |
| 177 | VARCO-VISION-14B | Multimodal | Vision-Language | 15.2B | — | 35.6 GB | 85.1MMBench | — | — | OpenVLM |
| 178 | VARCO-VISION-2.0-14B | Multimodal | Vision-Language | 15.2B | — | 35.6 GB | —— | — | — | OpenVLM |
| 179 | DeepSeek-VL2-Small | Multimodal | Vision-Language | 16.1B | — | 37.7 GB | 82.8MMBench | — | — | OpenVLM |
| 180 | Ovis2-16B | Multimodal | Vision-Language | 16.2B | — | 38.0 GB | 87.2MMBench | — | — | OpenVLM |
| 181 | Kimi-VL-A3B-Instruct | Multimodal | Vision-Language | 16.4B | — | 38.4 GB | 82.1MMBench | — | — | OpenVLM |
| 182 | Kimi-VL-A3B-Thinking | Multimodal | Vision-Language | 16.4B | — | 38.4 GB | —— | — | — | OpenVLM |
| 183 | Kimi-VL-A3B-Thinking-2506 | Multimodal | Vision-Language | 16.4B | — | 38.4 GB | —— | — | — | OpenVLM |
| 184 | CogVLM-17B-Chat | Multimodal | Vision-Language | 17.0B | — | 39.8 GB | 65.8MMBench | — | — | OpenVLM |
| 185 | bailingMM-mini | Multimodal | Vision-Language | 17.0B | — | 39.8 GB | —— | — | — | OpenVLM |
| 186 | CogVLM2-19B-Chat | Multimodal | Vision-Language | 19.0B | — | 44.5 GB | 73.9MMBench | — | — | OpenVLM |
| 187 | LLaVA-InternLM2-20B (QLoRA) | Multimodal | Vision-Language | 20.2B | — | 47.3 GB | 75.1MMBench | — | — | OpenVLM |
| 188 | BailingMM-Lite-1203 | Multimodal | Vision-Language | 21.0B | — | 49.2 GB | 84.0MMBench | — | — | OpenVLM |
| 189 | Aria | Multimodal | Vision-Language | 25.3B | — | 59.3 GB | 80.0MMBench | — | — | OpenVLM |
| 190 | InternVL-Chat-V1.5 | Multimodal | Vision-Language | 26.0B | — | 60.9 GB | 82.3MMBench | — | — | OpenVLM |
| 191 | InternVL2-26B | Multimodal | Vision-Language | 26.0B | — | 60.9 GB | 83.4MMBench | — | — | OpenVLM |
| 192 | MMAlaya2 | Multimodal | Vision-Language | 26.0B | — | 60.9 GB | 82.5MMBench | — | — | OpenVLM |
| 193 | InternVL2.5-26B | Multimodal | Vision-Language | 26.0B | — | 60.9 GB | —— | — | — | OpenVLM |
| 194 | InternVL2.5-26B-MPO | Multimodal | Vision-Language | 26.0B | — | 60.9 GB | 85.6MMBench | — | — | OpenVLM |
| 195 | Gemma3-27B | Multimodal | Vision-Language | 27.4B | — | 64.2 GB | 82.3MMBench | — | — | OpenVLM |
| 196 | DeepSeek-VL2 | Multimodal | Vision-Language | 27.5B | — | 64.5 GB | 84.1MMBench | — | — | OpenVLM |
| 197 | Ovis1.6-Gemma2-27B | Multimodal | Vision-Language | 28.9B | — | 67.7 GB | 84.8MMBench | — | — | OpenVLM |
| 198 | Chameleon-30B | Multimodal | Vision-Language | 30.0B | — | 70.3 GB | 32.5MMBench | — | — | OpenVLM |
| 199 | KoreaDeep-VLM-OCR-32B | Multimodal | Vision-Language | 32.0B | — | 75.0 GB | —— | — | — | OpenVLM |
| 200 | LLaVA-Next-Qwen-32B | Multimodal | Vision-Language | 33.0B | — | 77.3 GB | 79.4MMBench | — | — | OpenVLM |
| 201 | Qwen2.5-VL-32B | Multimodal | Vision-Language | 33.5B | — | 78.5 GB | —— | — | — | OpenVLM |
| 202 | Cambrian-34B | Multimodal | Vision-Language | 34.0B | — | 79.7 GB | 80.4MMBench | — | — | OpenVLM |
| 203 | Yi-VL-34B | Multimodal | Vision-Language | 34.6B | — | 81.1 GB | 72.4MMBench | — | — | OpenVLM |
| 204 | LLaVA-Next-Yi-34B | Multimodal | Vision-Language | 34.8B | — | 81.6 GB | 81.1MMBench | — | — | OpenVLM |
| 205 | Ovis2-34B | Multimodal | Vision-Language | 34.9B | — | 81.8 GB | 87.6MMBench | — | — | OpenVLM |
| 206 | Eagle-X5-34B-Chat | Multimodal | Vision-Language | 36.8B | — | 86.3 GB | 80.0MMBench | — | — | OpenVLM |
| 207 | Emu2_chat | Multimodal | Vision-Language | 37.0B | — | 86.7 GB | 63.6MMBench | — | — | OpenVLM |
| 208 | InternVL2.5-38B | Multimodal | Vision-Language | 38.0B | — | 89.1 GB | —— | — | — | OpenVLM |
| 209 | InternVL2.5-38B-MPO | Multimodal | Vision-Language | 38.0B | — | 89.1 GB | 86.4MMBench | — | — | OpenVLM |
| 210 | InternVL3-38B | Multimodal | Vision-Language | 38.4B | — | 90.0 GB | 87.7MMBench | — | — | OpenVLM |
| 211 | InternVL2-40B | Multimodal | Vision-Language | 40.0B | — | 93.8 GB | 86.8MMBench | — | — | OpenVLM |
| 212 | VILA1.5-40B | Multimodal | Vision-Language | 40.0B | — | 93.8 GB | 81.7MMBench | — | — | OpenVLM |
| 213 | VITA | Multimodal | Vision-Language | 47.0B | — | 110.2 GB | —— | — | — | OpenVLM |
| 214 | 360VL-70B | Multimodal | Vision-Language | 70.0B | — | 164.1 GB | 78.8MMBench | — | — | OpenVLM |
| 215 | Qwen-VL-Max-0809 | Multimodal | Vision-Language | 72.0B | — | 168.8 GB | 86.8MMBench | — | — | OpenVLM |
| 216 | LLaVA-OneVision-72B (SI) | Multimodal | Vision-Language | 73.0B | — | 171.1 GB | —— | — | — | OpenVLM |
| 217 | LLaVA-OneVision-72B | Multimodal | Vision-Language | 73.0B | — | 171.1 GB | 85.8MMBench | — | — | OpenVLM |
| 218 | Molmo-72B | Multimodal | Vision-Language | 73.3B | — | 171.8 GB | —— | — | — | OpenVLM |
| 219 | Qwen2-VL-72B | Multimodal | Vision-Language | 73.4B | — | 172.0 GB | 86.9MMBench | — | — | OpenVLM |
| 220 | Qwen2.5-VL-72B | Multimodal | Vision-Language | 73.4B | — | 172.0 GB | 88.3MMBench | — | — | OpenVLM |
| 221 | InternVL2-Llama3-76B | Multimodal | Vision-Language | 76.0B | — | 178.1 GB | 86.5MMBench | — | — | OpenVLM |
| 222 | InternVL2.5-78B | Multimodal | Vision-Language | 78.0B | — | 182.8 GB | 88.2MMBench | — | — | OpenVLM |
| 223 | InternVL2.5-78B-MPO | Multimodal | Vision-Language | 78.0B | — | 182.8 GB | 88.4MMBench | — | — | OpenVLM |
| 224 | InternVL3-78B | Multimodal | Vision-Language | 78.4B | — | 183.8 GB | 88.8MMBench | — | — | OpenVLM |
| 225 | RBDash-v1.5 | Multimodal | Vision-Language | 79.0B | — | 185.2 GB | 84.6MMBench | — | — | OpenVLM |
| 226 | NVLM-D-72B | Multimodal | Vision-Language | 79.4B | — | 186.1 GB | 80.4MMBench | — | — | OpenVLM |
| 227 | IDEFICS-80B-Instruct | Multimodal | Vision-Language | 80.0B | — | 187.5 GB | 54.6MMBench | — | — | OpenVLM |
| 228 | BailingMM-Pro-0120 | Multimodal | Vision-Language | 81.0B | — | 189.8 GB | 87.1MMBench | — | — | OpenVLM |
| 229 | Llama-3.2-90B-Vision-Instruct | Multimodal | Vision-Language | 88.6B | — | 207.7 GB | 80.4MMBench | — | — | OpenVLM |
| 230 | GPT-4o (0513, detail-high) | Multimodal | Vision-Language | — | — | — | 83.4MMBench | — | — | OpenVLM |
| 231 | GPT-4o (0513, detail-low) | Multimodal | Vision-Language | — | — | — | 83.3MMBench | — | — | OpenVLM |
| 232 | GLM-4v | Multimodal | Vision-Language | — | — | — | 81.3MMBench | — | — | OpenVLM |
| 233 | GPT-4v (0409, detail-high) | Multimodal | Vision-Language | — | — | — | 81.0MMBench | — | — | OpenVLM |
| 234 | GPT-4v (0409, detail-low) | Multimodal | Vision-Language | — | — | — | 80.8MMBench | — | — | OpenVLM |
| 235 | Qwen-VL-Max | Multimodal | Vision-Language | — | — | — | 77.6MMBench | — | — | OpenVLM |
| 236 | GPT-4v (1106, detail-low) | Multimodal | Vision-Language | — | — | — | 77.0MMBench | — | — | OpenVLM |
| 237 | RekaFlash | Multimodal | Vision-Language | — | — | — | 76.8MMBench | — | — | OpenVLM |
| 238 | Gemini-1.0-Pro | Multimodal | Vision-Language | — | — | — | 73.6MMBench | — | — | OpenVLM |
| 239 | Claude3-Sonnet | Multimodal | Vision-Language | — | — | — | 67.8MMBench | — | — | OpenVLM |
| 240 | Qwen-VL-Plus | Multimodal | Vision-Language | — | — | — | 67.0MMBench | — | — | OpenVLM |
| 241 | RekaEdge | Multimodal | Vision-Language | — | — | — | 66.4MMBench | — | — | OpenVLM |
| 242 | GPT-4v (1106, detail-high) | Multimodal | Vision-Language | — | — | — | 65.4MMBench | — | — | OpenVLM |
| 243 | Claude3-Opus | Multimodal | Vision-Language | — | — | — | 63.3MMBench | — | — | OpenVLM |
| 244 | Claude3-Haiku | Multimodal | Vision-Language | — | — | — | 60.7MMBench | — | — | OpenVLM |
| 245 | Gemini-1.5-Pro | Multimodal | Vision-Language | — | — | — | 73.9MMBench | — | — | OpenVLM |
| 246 | Claude3.5-Sonnet | Multimodal | Vision-Language | — | — | — | 79.7MMBench | — | — | OpenVLM |
| 247 | CongRong | Multimodal | Vision-Language | — | — | — | 82.8MMBench | — | — | OpenVLM |
| 248 | GPT-4o-mini (0718, detail-high) | Multimodal | Vision-Language | — | — | — | 77.6MMBench | — | — | OpenVLM |
| 249 | Yi-Vision | Multimodal | Vision-Language | — | — | — | 78.1MMBench | — | — | OpenVLM |
| 250 | GPT-4o (0806, detail-high) | Multimodal | Vision-Language | — | — | — | 82.1MMBench | — | — | OpenVLM |
| 251 | Step-1.5V | Multimodal | Vision-Language | — | — | — | 85.3MMBench | — | — | OpenVLM |
| 252 | Gemini-1.5-Flash | Multimodal | Vision-Language | — | — | — | 79.4MMBench | — | — | OpenVLM |
| 253 | Qwen-VL-Plus-0809 | Multimodal | Vision-Language | — | — | — | 82.7MMBench | — | — | OpenVLM |
| 254 | Claude3.5-Sonnet-20241022 | Multimodal | Vision-Language | — | — | — | 82.6MMBench | — | — | OpenVLM |
| 255 | Taiyi | Multimodal | Vision-Language | — | — | — | 86.7MMBench | — | — | OpenVLM |
| 256 | JT-VL-Chat-V3.0 | Multimodal | Vision-Language | — | — | — | —— | — | — | OpenVLM |
| 257 | TeleMM | Multimodal | Vision-Language | — | — | — | —— | — | — | OpenVLM |
| 258 | Gemini-1.5-Pro-002 | Multimodal | Vision-Language | — | — | — | —— | — | — | OpenVLM |
| 259 | Gemini-1.5-Flash-002 | Multimodal | Vision-Language | — | — | — | —— | — | — | OpenVLM |
| 260 | GPT-4o (1120, detail-high) | Multimodal | Vision-Language | — | — | — | —— | — | — | OpenVLM |
| 261 | GLM-4v-Plus | Multimodal | Vision-Language | — | — | — | 81.4MMBench | — | — | OpenVLM |
| 262 | Step-1.5V-mini | Multimodal | Vision-Language | — | — | — | 18.1MMBench | — | — | OpenVLM |
| 263 | abab6.5s | Multimodal | Vision-Language | — | — | — | 61.0MMBench | — | — | OpenVLM |
| 264 | abab7-preview | Multimodal | Vision-Language | — | — | — | 84.5MMBench | — | — | OpenVLM |
| 265 | SenseNova | Multimodal | Vision-Language | — | — | — | —— | — | — | OpenVLM |
| 266 | Gemini-2.0-Flash | Multimodal | Vision-Language | — | — | — | —— | — | — | OpenVLM |
| 267 | Step-1o | Multimodal | Vision-Language | — | — | — | 88.3MMBench | — | — | OpenVLM |
| 268 | HunYuan-Standard-Vision | Multimodal | Vision-Language | — | — | — | 86.4MMBench | — | — | OpenVLM |
| 269 | GLM-4v-Plus-20250111 | Multimodal | Vision-Language | — | — | — | 88.9MMBench | — | — | OpenVLM |
| 270 | Gemini-2.0-Pro | Multimodal | Vision-Language | — | — | — | 84.3MMBench | — | — | OpenVLM |
| 271 | Claude3.7-Sonnet | Multimodal | Vision-Language | — | — | — | 81.4MMBench | — | — | OpenVLM |
| 272 | moonshot-v1-8k | Multimodal | Vision-Language | — | — | — | 79.3MMBench | — | — | OpenVLM |
| 273 | grok-2-vision-1212 | Multimodal | Vision-Language | — | — | — | 85.3MMBench | — | — | OpenVLM |
| 274 | GPT-4.5 | Multimodal | Vision-Language | — | — | — | —— | — | — | OpenVLM |
| 275 | ChatGPT-4o-latest | Multimodal | Vision-Language | — | — | — | —— | — | — | OpenVLM |
| 276 | Gemini-2.5-Pro | Multimodal | Vision-Language | — | — | — | —— | — | — | OpenVLM |
| 277 | GPT-4.1-20250414 | Multimodal | Vision-Language | — | — | — | 86.9MMBench | — | — | OpenVLM |
| 278 | GPT-4.1-mini-20250414 | Multimodal | Vision-Language | — | — | — | 86.9MMBench | — | — | OpenVLM |
| 279 | GPT-4.1-nano-20250414 | Multimodal | Vision-Language | — | — | — | 68.2MMBench | — | — | OpenVLM |
| 280 | SenseNova-V6-Pro | Multimodal | Vision-Language | — | — | — | —— | — | — | OpenVLM |
| 281 | CongRong-v2.0 | Multimodal | Vision-Language | — | — | — | —— | — | — | OpenVLM |
| 282 | GPT-5-20250807 | Multimodal | Vision-Language | — | — | — | —— | — | — | OpenVLM |
| 283 | GPT-5-nano-20250807 | Multimodal | Vision-Language | — | — | — | —— | — | — | OpenVLM |
| 284 | GPT-5-mini-20250807 | Multimodal | Vision-Language | — | — | — | —— | — | — | OpenVLM |
| 285 | SenseNova-V6-5-Pro | Multimodal | Vision-Language | — | — | — | —— | — | — | OpenVLM |