Domain
Showing 299 models
| # | Model | Domain | Task | Params ↑ | GFLOPs | VRAM | Context | Speed | Arch | Source |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | SmolVLM-256M | Multimodal | Vision-Language | 260.0M | — | 624 MB | 5 | — | — | OpenVLM |
| 2 | SmolVLM2-256M | Multimodal | Vision-Language | 260.0M | — | 624 MB | 1 | — | — | OpenVLM |
| 3 | SmolVLM-500M | Multimodal | Vision-Language | 510.0M | — | 1.2 GB | 8 | — | — | OpenVLM |
| 4 | SmolVLM2-500M | Multimodal | Vision-Language | 510.0M | — | 1.2 GB | 7 | — | — | OpenVLM |
| 5 | H2OVL-800M | Multimodal | Vision-Language | 830.0M | — | 1.9 GB | 10 | — | — | OpenVLM |
| 6 | InternVL3-1B | Multimodal | Vision-Language | 940.0M | — | 2.2 GB | 37 | — | — | OpenVLM |
| 7 | InternVL2-1B | Multimodal | Vision-Language | 1.0B | — | 2.3 GB | 17 | — | — | OpenVLM |
| 8 | LLaVA-OneVision-0.5B | Multimodal | Vision-Language | 1.0B | — | 2.3 GB | 12 | — | — | OpenVLM |
| 9 | LLaVA-OneVision-0.5B (SI) | Multimodal | Vision-Language | 1.0B | — | 2.3 GB | 9 | — | — | OpenVLM |
| 10 | InternVL2.5-1B | Multimodal | Vision-Language | 1.0B | — | 2.3 GB | — | — | — | OpenVLM |
| 11 | InternVL2.5-1B-MPO | Multimodal | Vision-Language | 1.0B | — | 2.3 GB | 30 | — | — | OpenVLM |
| 12 | Ovis2-1B | Multimodal | Vision-Language | 1.3B | — | 3.0 GB | 34 | — | — | OpenVLM |
| 13 | Kosmos2 | Multimodal | Vision-Language | 1.7B | — | 4.0 GB | 0 | — | — | OpenVLM |
| 14 | Moondream1 | Multimodal | Vision-Language | 1.9B | — | 4.5 GB | 13 | — | — | OpenVLM |
| 15 | Moondream2 | Multimodal | Vision-Language | 1.9B | — | 4.5 GB | 30 | — | — | OpenVLM |
| 16 | InternLM-XComposer2-1.8B | Multimodal | Vision-Language | 2.0B | — | 4.7 GB | 39 | — | — | OpenVLM |
| 17 | DeepSeek-VL-1.3B | Multimodal | Vision-Language | 2.0B | — | 4.7 GB | 20 | — | — | OpenVLM |
| 18 | Mini-InternVL-Chat-2B-V1.5 | Multimodal | Vision-Language | 2.0B | — | 4.7 GB | 32 | — | — | OpenVLM |
| 19 | InternVL2-2B | Multimodal | Vision-Language | 2.0B | — | 4.7 GB | 40 | — | — | OpenVLM |
| 20 | Qwen2-VL-2B | Multimodal | Vision-Language | 2.0B | — | 4.7 GB | 46 | — | — | OpenVLM |
| 21 | XinYuan-VL-2B-Instruct | Multimodal | Vision-Language | 2.0B | — | 4.7 GB | 57 | — | — | OpenVLM |
| 22 | InternVL2.5-2B | Multimodal | Vision-Language | 2.0B | — | 4.7 GB | — | — | — | OpenVLM |
| 23 | InternVL2.5-2B-MPO | Multimodal | Vision-Language | 2.0B | — | 4.7 GB | 45 | — | — | OpenVLM |
| 24 | ShowUI ui-understandingelement-groundinggui-agent | Multimodal | UI Understanding | 2.0B | — | 4.7 GB | 13 | — | Qwen2-VL-2B + UI-guided token selection | Curated |
| 25 | UI-TARS-2B (ByteDance) ui-understandinggui-agentelement-grounding | Multimodal | UI Understanding | 2.0B | — | 4.7 GB | 38 | — | Qwen2-VL-2B fine-tuned | Curated |
| 26 | InternVL3-2B | Multimodal | Vision-Language | 2.1B | — | 4.9 GB | 68 | — | — | OpenVLM |
| 27 | QTuneVL1.5-2B | Multimodal | Vision-Language | 2.1B | — | 4.9 GB | — | — | — | OpenVLM |
| 28 | Janus-1.3B | Multimodal | Vision-Language | 2.1B | — | 4.9 GB | 7 | — | — | OpenVLM |
| 29 | SAIL-VL-2B | Multimodal | Vision-Language | 2.1B | — | 4.9 GB | 59 | — | — | OpenVLM |
| 30 | VARCO-VISION-2.0-1.7B | Multimodal | Vision-Language | 2.1B | — | 5.0 GB | — | — | — | OpenVLM |
| 31 | MiniMonkey | Multimodal | Vision-Language | 2.2B | — | 5.2 GB | 37 | — | — | OpenVLM |
| 32 | Aquila-VL-2B | Multimodal | Vision-Language | 2.2B | — | 5.2 GB | 60 | — | — | OpenVLM |
| 33 | H2OVL-2B | Multimodal | Vision-Language | 2.2B | — | 5.2 GB | 36 | — | — | OpenVLM |
| 34 | QTuneVL1-2B | Multimodal | Vision-Language | 2.2B | — | 5.2 GB | — | — | — | OpenVLM |
| 35 | SmolVLM2 | Multimodal | Vision-Language | 2.3B | — | 5.3 GB | 33 | — | — | OpenVLM |
| 36 | SmolVLM-Instruct | Multimodal | Vision-Language | 2.3B | — | 5.4 GB | 22 | — | — | OpenVLM |
| 37 | SmolVLM-Instruct-DPO | Multimodal | Vision-Language | 2.3B | — | 5.4 GB | 17 | — | — | OpenVLM |
| 38 | SmolVLM-Synthetic | Multimodal | Vision-Language | 2.3B | — | 5.4 GB | 8 | — | — | OpenVLM |
| 39 | HawkVL-2B | Multimodal | Vision-Language | 2.4B | — | 5.7 GB | — | — | — | OpenVLM |
| 40 | Ovis2-2B | Multimodal | Vision-Language | 2.5B | — | 5.8 GB | 58 | — | — | OpenVLM |
| 41 | SAIL-VL-1.5-2B | Multimodal | Vision-Language | 2.5B | — | 5.8 GB | — | — | — | OpenVLM |
| 42 | Flash-VL-2B-Dynamic-ISS | Multimodal | Vision-Language | 2.5B | — | 5.9 GB | — | — | — | OpenVLM |
| 43 | MiniCPM-V-2 | Multimodal | Vision-Language | 2.8B | — | 6.6 GB | 27 | — | — | OpenVLM |
| 44 | BlueLM-2.5-3B | Multimodal | Vision-Language | 2.9B | — | 6.8 GB | — | — | — | OpenVLM |
| 45 | granite-vision-3.1-2b-preview | Multimodal | Vision-Language | 3.0B | — | 7.0 GB | — | — | — | OpenVLM |
| 46 | granite-vision-3.2-2b | Multimodal | Vision-Language | 3.0B | — | 7.0 GB | 55 | — | — | OpenVLM |
| 47 | granite-vision-3.3-2b | Multimodal | Vision-Language | 3.0B | — | 7.0 GB | 41 | — | — | OpenVLM |
| 48 | PaliGemma-3B-mix-448 | Multimodal | Vision-Language | 3.0B | — | 7.0 GB | 33 | — | — | OpenVLM |
| 49 | MiniCPM-V | Multimodal | Vision-Language | 3.0B | — | 7.0 GB | 15 | — | — | OpenVLM |
| 50 | VILA1.5-3B | Multimodal | Vision-Language | 3.0B | — | 7.0 GB | 16 | — | — | OpenVLM |
| 51 | BlueLM-V-3B | Multimodal | Vision-Language | 3.0B | — | 7.0 GB | 87 | — | — | OpenVLM |
| 52 | BlueLM-2.6-3B | Multimodal | Vision-Language | 3.0B | — | 7.0 GB | — | — | — | OpenVLM |
| 53 | DeepSeek-VL2-Tiny | Multimodal | Vision-Language | 3.4B | — | 8.0 GB | 46 | — | — | OpenVLM |
| 54 | Ovis-U1-3B | Multimodal | Vision-Language | 3.6B | — | 8.5 GB | — | — | — | OpenVLM |
| 55 | Vintern-3B-beta | Multimodal | Vision-Language | 3.7B | — | 8.7 GB | 31 | — | — | OpenVLM |
| 56 | Vintern-1B-v2 | Multimodal | Vision-Language | 3.7B | — | 8.7 GB | — | — | — | OpenVLM |
| 57 | Qwen2.5-VL-3B | Multimodal | Vision-Language | 3.8B | — | 8.8 GB | 60 | — | — | OpenVLM |
| 58 | QTuneVL1.5-3B | Multimodal | Vision-Language | 3.8B | — | 8.8 GB | — | — | — | OpenVLM |
| 59 | Ristretto-3B | Multimodal | Vision-Language | 3.8B | — | 9.0 GB | — | — | — | OpenVLM |
| 60 | Mini-InternVL-Chat-4B-V1.5 | Multimodal | Vision-Language | 4.0B | — | 9.4 GB | 49 | — | — | OpenVLM |
| 61 | InternVL2-4B | Multimodal | Vision-Language | 4.0B | — | 9.4 GB | 58 | — | — | OpenVLM |
| 62 | Phi-3.5-Vision | Multimodal | Vision-Language | 4.0B | — | 9.4 GB | 50 | — | — | OpenVLM |
| 63 | InternVL2.5-4B | Multimodal | Vision-Language | 4.0B | — | 9.4 GB | — | — | — | OpenVLM |
| 64 | InternVL2.5-4B-MPO | Multimodal | Vision-Language | 4.0B | — | 9.4 GB | 65 | — | — | OpenVLM |
| 65 | Ovis1.6-Llama3.2-3B | Multimodal | Vision-Language | 4.1B | — | 9.6 GB | 57 | — | — | OpenVLM |
| 66 | Phi-3-Vision | Multimodal | Vision-Language | 4.2B | — | 9.8 GB | 42 | — | — | OpenVLM |
| 67 | Gemma3-4B | Multimodal | Vision-Language | 4.3B | — | 10.1 GB | 28 | — | — | OpenVLM |
| 68 | AKI-4B | Multimodal | Vision-Language | 4.3B | — | 10.1 GB | 25 | — | — | OpenVLM |
| 69 | XGen-MM-Instruct-Interleave-v1.5 | Multimodal | Vision-Language | 4.4B | — | 10.3 GB | 56 | — | — | OpenVLM |
| 70 | XGen-MM-Instruct-DPO-v1.5 | Multimodal | Vision-Language | 4.4B | — | 10.3 GB | 54 | — | — | OpenVLM |
| 71 | Ovis2-4B | Multimodal | Vision-Language | 4.6B | — | 10.8 GB | 84 | — | — | OpenVLM |
| 72 | R-4B | Multimodal | Vision-Language | 4.8B | — | 11.3 GB | — | — | — | OpenVLM |
| 73 | ScreenAI (Google) ui-understandingscreenshot-qascreen2words | Multimodal | UI Understanding | 5.0B | — | 11.7 GB | — | — | PaLI-based VLM | Curated |
| 74 | Phi-4-MultiModal | Multimodal | Vision-Language | 5.6B | — | 13.1 GB | 81 | — | — | OpenVLM |
| 75 | Yi-VL-6B | Multimodal | Vision-Language | 6.6B | — | 15.5 GB | 25 | — | — | OpenVLM |
| 76 | InternLM-XComposer2 | Multimodal | Vision-Language | 7.0B | — | 16.4 GB | 67 | — | — | OpenVLM |
| 77 | InternLM-XComposer2-4KHD | Multimodal | Vision-Language | 7.0B | — | 16.4 GB | 64 | — | — | OpenVLM |
| 78 | WeMM | Multimodal | Vision-Language | 7.0B | — | 16.4 GB | 61 | — | — | OpenVLM |
| 79 | Chameleon-7B | Multimodal | Vision-Language | 7.0B | — | 16.4 GB | 2 | — | — | OpenVLM |
| 80 | Slime-7B | Multimodal | Vision-Language | 7.0B | — | 16.4 GB | 18 | — | — | OpenVLM |
| 81 | MUG-U-7B | Multimodal | Vision-Language | 7.0B | — | 16.4 GB | 85 | — | — | OpenVLM |
| 82 | Ferret-UI (Apple) ui-understandingscreenshot-analysiselement-grounding | Multimodal | UI Understanding | 7.0B | — | 16.4 GB | 63 | — | Ferret + any-resolution | Curated |
| 83 | Ferret-UI 2 (Apple) ui-understandingscreenshot-analysiselement-grounding | Multimodal | UI Understanding | 7.0B | — | 16.4 GB | — | — | Ferret-UI + multi-platform | Curated |
| 84 | UI-TARS-7B (ByteDance) ui-understandinggui-agentelement-grounding | Multimodal | UI Understanding | 7.0B | — | 16.4 GB | 75 | — | Qwen2-VL-7B fine-tuned | Curated |
| 85 | UGround (UIX-Qwen2-7B) ui-understandingelement-grounding | Multimodal | UI Understanding | 7.0B | — | 16.4 GB | 25 | — | Qwen2-VL-7B fine-tuned | Curated |
| 86 | Aguvis-7B ui-understandinggui-agentelement-grounding | Multimodal | UI Understanding | 7.0B | — | 16.4 GB | — | — | Qwen2-VL-7B fine-tuned | Curated |
| 87 | OS-Atlas-Pro-7B ui-understandinggui-agentelement-grounding | Multimodal | UI Understanding | 7.0B | — | 16.4 GB | 50 | — | InternVL2-based | Curated |
| 88 | LLaVA-Next-Vicuna-7B | Multimodal | Vision-Language | 7.1B | — | 16.6 GB | 28 | — | — | OpenVLM |
| 89 | LLaVA-v1.5-7B (QLoRA) | Multimodal | Vision-Language | 7.2B | — | 16.9 GB | 23 | — | — | OpenVLM |
| 90 | ShareGPT4V-7B | Multimodal | Vision-Language | 7.2B | — | 16.9 GB | 22 | — | — | OpenVLM |
| 91 | LLaVA-v1.5-7B | Multimodal | Vision-Language | 7.2B | — | 16.9 GB | 20 | — | — | OpenVLM |
| 92 | LLaVA-v1-7B | Multimodal | Vision-Language | 7.2B | — | 16.9 GB | 6 | — | — | OpenVLM |
| 93 | MolmoE-1B | Multimodal | Vision-Language | 7.2B | — | 16.9 GB | 16 | — | — | OpenVLM |
| 94 | DeepSeek-VL-7B | Multimodal | Vision-Language | 7.3B | — | 17.1 GB | 43 | — | — | OpenVLM |
| 95 | Janus-Pro-7B | Multimodal | Vision-Language | 7.4B | — | 17.4 GB | 13 | — | — | OpenVLM |
| 96 | LLaVA-Next-Mistral-7B | Multimodal | Vision-Language | 7.6B | — | 17.8 GB | 29 | — | — | OpenVLM |
| 97 | LLaVA-InternLM-7B (QLoRA) | Multimodal | Vision-Language | 7.6B | — | 17.8 GB | 27 | — | — | OpenVLM |
| 98 | MMAlaya | Multimodal | Vision-Language | 7.8B | — | 18.3 GB | 10 | — | — | OpenVLM |
| 99 | InternVL3-8B | Multimodal | Vision-Language | 7.9B | — | 18.6 GB | 83 | — | — | OpenVLM |
| 100 | SAIL-VL-1.5-8B | Multimodal | Vision-Language | 8.0B | — | 18.6 GB | — | — | — | OpenVLM |
| 101 | MiniCPM-Llama3-V2.5 | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 53 | — | — | OpenVLM |
| 102 | IDEFICS2-8B | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 49 | — | — | OpenVLM |
| 103 | InternLM-XComposer | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 45 | — | — | OpenVLM |
| 104 | LLaVA-LLaMA-3-8B | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 35 | — | — | OpenVLM |
| 105 | ShareCaptioner | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 21 | — | — | OpenVLM |
| 106 | VisualGLM | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 4 | — | — | OpenVLM |
| 107 | InstructBLIP-7B | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 4 | — | — | OpenVLM |
| 108 | MiniGPT-4-v1-7B | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 3 | — | — | OpenVLM |
| 109 | MiniGPT-4-v2 | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 1 | — | — | OpenVLM |
| 110 | InternVL2-8B | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 74 | — | — | OpenVLM |
| 111 | Cambrian-8B | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 47 | — | — | OpenVLM |
| 112 | InternLM-XComposer2.5 | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 73 | — | — | OpenVLM |
| 113 | Bunny-Llama3-8B | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 57 | — | — | OpenVLM |
| 114 | Ovis1.5-Llama3-8B | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 68 | — | — | OpenVLM |
| 115 | LLaVA-Next-Llama3 | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 47 | — | — | OpenVLM |
| 116 | LLaVA-Next-Interleave-7B-DPO | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 43 | — | — | OpenVLM |
| 117 | LLaVA-Next-Interleave-7B | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 47 | — | — | OpenVLM |
| 118 | Mantis-8B-clip-llama3 | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 24 | — | — | OpenVLM |
| 119 | Mantis-8B-siglip-llama3 | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 26 | — | — | OpenVLM |
| 120 | Mantis-8B-Idefics2 | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 50 | — | — | OpenVLM |
| 121 | MiniCPM-V-2.6 | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 72 | — | — | OpenVLM |
| 122 | Llama-3-MixSense-v1.1 | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 51 | — | — | OpenVLM |
| 123 | Parrot-7B | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 35 | — | — | OpenVLM |
| 124 | Llama-3-VILA1.5-8B | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 13 | — | — | OpenVLM |
| 125 | Idefics3-8B-Llama3 | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 52 | — | — | OpenVLM |
| 126 | Qwen2-VL-7B | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 79 | — | — | OpenVLM |
| 127 | Mantis-8B-Fuyu | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 7 | — | — | OpenVLM |
| 128 | Slime-8B | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 39 | — | — | OpenVLM |
| 129 | LLaVA-OneVision-7B | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 80 | — | — | OpenVLM |
| 130 | LLaVA-OneVision-7B (SI) | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 67 | — | — | OpenVLM |
| 131 | Molmo-7B-D | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 41 | — | — | OpenVLM |
| 132 | Molmo-7B-O | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 36 | — | — | OpenVLM |
| 133 | InternVL2-8B-MPO | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 60 | — | — | OpenVLM |
| 134 | InternVL2-8B-MPO-CoT | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 56 | — | — | OpenVLM |
| 135 | InternVL2.5-8B | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | — | — | — | OpenVLM |
| 136 | InternVL2.5-8B-MPO | Multimodal | Vision-Language | 8.0B | — | 18.8 GB | 85 | — | — | OpenVLM |
| 137 | LLaVA-InternLM2-7B (QLoRA) | Multimodal | Vision-Language | 8.1B | — | 19.0 GB | 40 | — | — | OpenVLM |
| 138 | mPLUG-Owl2 | Multimodal | Vision-Language | 8.2B | — | 19.2 GB | 19 | — | — | OpenVLM |
| 139 | Ross-Qwen2-7B | Multimodal | Vision-Language | 8.2B | — | 19.2 GB | 67 | — | — | OpenVLM |
| 140 | Qwen2.5-VL-7B | Multimodal | Vision-Language | 8.3B | — | 19.4 GB | 80 | — | — | OpenVLM |
| 141 | WeThink-Qwen2.5VL-7B | Multimodal | Vision-Language | 8.3B | — | 19.4 GB | — | — | — | OpenVLM |
| 142 | POINTS-Qwen2.5-7B | Multimodal | Vision-Language | 8.3B | — | 19.5 GB | 72 | — | — | OpenVLM |
| 143 | POINTS1.5-Qwen2.5-7B | Multimodal | Vision-Language | 8.3B | — | 19.5 GB | 79 | — | — | OpenVLM |
| 144 | VITA-1.5 | Multimodal | Vision-Language | 8.3B | — | 19.5 GB | 63 | — | — | OpenVLM |
| 145 | MiMo-VL-7B | Multimodal | Vision-Language | 8.3B | — | 19.5 GB | — | — | — | OpenVLM |
| 146 | SAIL-VL-1.6-8B | Multimodal | Vision-Language | 8.3B | — | 19.5 GB | — | — | — | OpenVLM |
| 147 | Emu3_chat | Multimodal | Vision-Language | 8.5B | — | 19.9 GB | 15 | — | — | OpenVLM |
| 148 | MiniCPM-o-2.6 | Multimodal | Vision-Language | 8.7B | — | 20.3 GB | 82 | — | — | OpenVLM |
| 149 | Ola-7b | Multimodal | Vision-Language | 8.9B | — | 20.8 GB | 97 | — | — | OpenVLM |
| 150 | valley2 | Multimodal | Vision-Language | 8.9B | — | 20.8 GB | — | — | — | OpenVLM |
| 151 | valley2_dpo | Multimodal | Vision-Language | 8.9B | — | 20.8 GB | — | — | — | OpenVLM |
| 152 | Valley-Eagle | Multimodal | Vision-Language | 8.9B | — | 20.9 GB | — | — | — | OpenVLM |
| 153 | Ovis2-8B | Multimodal | Vision-Language | 8.9B | — | 21.0 GB | 88 | — | — | OpenVLM |
| 154 | IDEFICS-9B-Instruct | Multimodal | Vision-Language | 9.0B | — | 21.1 GB | 6 | — | — | OpenVLM |
| 155 | OpenFlamingo v2 | Multimodal | Vision-Language | 9.0B | — | 21.1 GB | 0 | — | — | OpenVLM |
| 156 | GLM-4v-9B | Multimodal | Vision-Language | 9.0B | — | 21.1 GB | 33 | — | — | OpenVLM |
| 157 | Eagle-X5-7B | Multimodal | Vision-Language | 9.0B | — | 21.1 GB | 31 | — | — | OpenVLM |
| 158 | InternVL3-9B | Multimodal | Vision-Language | 9.1B | — | 21.4 GB | 84 | — | — | OpenVLM |
| 159 | POINTS-Yi-1.5-9B | Multimodal | Vision-Language | 9.5B | — | 22.3 GB | 73 | — | — | OpenVLM |
| 160 | Qwen-VL-Chat | Multimodal | Vision-Language | 9.6B | — | 22.5 GB | 12 | — | — | OpenVLM |
| 161 | Qwen-VL | Multimodal | Vision-Language | 9.6B | — | 22.5 GB | 3 | — | — | OpenVLM |
| 162 | SeeClick ui-understandingelement-groundinggui-agent | Multimodal | UI Understanding | 9.6B | — | 22.5 GB | 0 | — | Qwen-VL + GUI grounding | Curated |
| 163 | Monkey-Chat | Multimodal | Vision-Language | 9.8B | — | 23.0 GB | 37 | — | — | OpenVLM |
| 164 | Monkey | Multimodal | Vision-Language | 9.8B | — | 23.0 GB | 10 | — | — | OpenVLM |
| 165 | Ovis1.6-Gemma2-9B | Multimodal | Vision-Language | 10.2B | — | 23.9 GB | 82 | — | — | OpenVLM |
| 166 | Llama-3.2-11B-Vision-Instruct | Multimodal | Vision-Language | 11.0B | — | 25.8 GB | 23 | — | — | OpenVLM |
| 167 | LLaVA-CoT | Multimodal | Vision-Language | 11.0B | — | 25.8 GB | — | — | — | OpenVLM |
| 168 | Ovis1.5-Gemma2-9B | Multimodal | Vision-Language | 11.4B | — | 26.7 GB | 69 | — | — | OpenVLM |
| 169 | Falcon2-VLM-11B | Multimodal | Vision-Language | 11.4B | — | 26.7 GB | 32 | — | — | OpenVLM |
| 170 | OmniLMM-12B | Multimodal | Vision-Language | 12.0B | — | 28.1 GB | 34 | — | — | OpenVLM |
| 171 | Gemma3-12B | Multimodal | Vision-Language | 12.2B | — | 28.6 GB | 52 | — | — | OpenVLM |
| 172 | XVERSE-V-13B | Multimodal | Vision-Language | 13.0B | — | 30.5 GB | 48 | — | — | OpenVLM |
| 173 | Cambrian-13B | Multimodal | Vision-Language | 13.0B | — | 30.5 GB | 40 | — | — | OpenVLM |
| 174 | OmChat-v2.0-13B | Multimodal | Vision-Language | 13.0B | — | 30.5 GB | 77 | — | — | OpenVLM |
| 175 | VILA1.5-13B | Multimodal | Vision-Language | 13.0B | — | 30.5 GB | 44 | — | — | OpenVLM |
| 176 | Slime-13B | Multimodal | Vision-Language | 13.0B | — | 30.5 GB | 17 | — | — | OpenVLM |
| 177 | Pixtral-12B | Multimodal | Vision-Language | 13.0B | — | 30.5 GB | 54 | — | — | OpenVLM |
| 178 | TransCore-M | Multimodal | Vision-Language | 13.4B | — | 31.4 GB | 76 | — | — | OpenVLM |
| 179 | LLaVA-Next-Vicuna-13B | Multimodal | Vision-Language | 13.4B | — | 31.4 GB | 30 | — | — | OpenVLM |
| 180 | ShareGPT4V-13B | Multimodal | Vision-Language | 13.4B | — | 31.4 GB | 29 | — | — | OpenVLM |
| 181 | LLaVA-v1.5-13B | Multimodal | Vision-Language | 13.4B | — | 31.4 GB | 27 | — | — | OpenVLM |
| 182 | LLaVA-v1.5-13B (QLoRA) | Multimodal | Vision-Language | 13.4B | — | 31.4 GB | 26 | — | — | OpenVLM |
| 183 | PandaGPT-13B | Multimodal | Vision-Language | 14.0B | — | 32.8 GB | 5 | — | — | OpenVLM |
| 184 | Long-VITA-16K | Multimodal | Vision-Language | 14.0B | — | 32.8 GB | — | — | — | OpenVLM |
| 185 | Eagle-X5-13B | Multimodal | Vision-Language | 15.0B | — | 35.2 GB | 38 | — | — | OpenVLM |
| 186 | InternVL3-14B | Multimodal | Vision-Language | 15.1B | — | 35.4 GB | 91 | — | — | OpenVLM |
| 187 | VARCO-VISION-14B | Multimodal | Vision-Language | 15.2B | — | 35.6 GB | 89 | — | — | OpenVLM |
| 188 | VARCO-VISION-2.0-14B | Multimodal | Vision-Language | 15.2B | — | 35.6 GB | — | — | — | OpenVLM |
| 189 | DeepSeek-VL2-Small | Multimodal | Vision-Language | 16.1B | — | 37.7 GB | 78 | — | — | OpenVLM |
| 190 | Ovis2-16B | Multimodal | Vision-Language | 16.2B | — | 38.0 GB | 96 | — | — | OpenVLM |
| 191 | Kimi-VL-A3B-Instruct | Multimodal | Vision-Language | 16.4B | — | 38.4 GB | 74 | — | — | OpenVLM |
| 192 | Kimi-VL-A3B-Thinking | Multimodal | Vision-Language | 16.4B | — | 38.4 GB | — | — | — | OpenVLM |
| 193 | Kimi-VL-A3B-Thinking-2506 | Multimodal | Vision-Language | 16.4B | — | 38.4 GB | — | — | — | OpenVLM |
| 194 | CogVLM-17B-Chat | Multimodal | Vision-Language | 17.0B | — | 39.8 GB | 19 | — | — | OpenVLM |
| 195 | bailingMM-mini | Multimodal | Vision-Language | 17.0B | — | 39.8 GB | — | — | — | OpenVLM |
| 196 | CogAgent ui-understandinggui-agentscreenshot-analysis | Multimodal | UI Understanding | 18.0B | — | 42.2 GB | — | — | CogVLM + high-res cross-module | Curated |
| 197 | CogVLM2-19B-Chat | Multimodal | Vision-Language | 19.0B | — | 44.5 GB | 44 | — | — | OpenVLM |
| 198 | LLaVA-InternLM2-20B (QLoRA) | Multimodal | Vision-Language | 20.2B | — | 47.3 GB | 48 | — | — | OpenVLM |
| 199 | BailingMM-Lite-1203 | Multimodal | Vision-Language | 21.0B | — | 49.2 GB | 86 | — | — | OpenVLM |
| 200 | Aria | Multimodal | Vision-Language | 25.3B | — | 59.3 GB | 63 | — | — | OpenVLM |
| 201 | InternVL-Chat-V1.5 | Multimodal | Vision-Language | 26.0B | — | 60.9 GB | 76 | — | — | OpenVLM |
| 202 | InternVL2-26B | Multimodal | Vision-Language | 26.0B | — | 60.9 GB | 83 | — | — | OpenVLM |
| 203 | MMAlaya2 | Multimodal | Vision-Language | 26.0B | — | 60.9 GB | 77 | — | — | OpenVLM |
| 204 | InternVL2.5-26B | Multimodal | Vision-Language | 26.0B | — | 60.9 GB | — | — | — | OpenVLM |
| 205 | InternVL2.5-26B-MPO | Multimodal | Vision-Language | 26.0B | — | 60.9 GB | 90 | — | — | OpenVLM |
| 206 | Gemma3-27B | Multimodal | Vision-Language | 27.4B | — | 64.2 GB | 75 | — | — | OpenVLM |
| 207 | DeepSeek-VL2 | Multimodal | Vision-Language | 27.5B | — | 64.5 GB | 86 | — | — | OpenVLM |
| 208 | Ovis1.6-Gemma2-27B | Multimodal | Vision-Language | 28.9B | — | 67.7 GB | 89 | — | — | OpenVLM |
| 209 | Chameleon-30B | Multimodal | Vision-Language | 30.0B | — | 70.3 GB | 3 | — | — | OpenVLM |
| 210 | KoreaDeep-VLM-OCR-32B | Multimodal | Vision-Language | 32.0B | — | 75.0 GB | — | — | — | OpenVLM |
| 211 | LLaVA-Next-Qwen-32B | Multimodal | Vision-Language | 33.0B | — | 77.3 GB | 62 | — | — | OpenVLM |
| 212 | Qwen2.5-VL-32B | Multimodal | Vision-Language | 33.5B | — | 78.5 GB | — | — | — | OpenVLM |
| 213 | Cambrian-34B | Multimodal | Vision-Language | 34.0B | — | 79.7 GB | 66 | — | — | OpenVLM |
| 214 | Yi-VL-34B | Multimodal | Vision-Language | 34.6B | — | 81.1 GB | 38 | — | — | OpenVLM |
| 215 | LLaVA-Next-Yi-34B | Multimodal | Vision-Language | 34.8B | — | 81.6 GB | 70 | — | — | OpenVLM |
| 216 | Ovis2-34B | Multimodal | Vision-Language | 34.9B | — | 81.8 GB | 97 | — | — | OpenVLM |
| 217 | Eagle-X5-34B-Chat | Multimodal | Vision-Language | 36.8B | — | 86.3 GB | 64 | — | — | OpenVLM |
| 218 | Emu2_chat | Multimodal | Vision-Language | 37.0B | — | 86.7 GB | 14 | — | — | OpenVLM |
| 219 | InternVL2.5-38B | Multimodal | Vision-Language | 38.0B | — | 89.1 GB | — | — | — | OpenVLM |
| 220 | InternVL2.5-38B-MPO | Multimodal | Vision-Language | 38.0B | — | 89.1 GB | 92 | — | — | OpenVLM |
| 221 | InternVL3-38B | Multimodal | Vision-Language | 38.4B | — | 90.0 GB | 97 | — | — | OpenVLM |
| 222 | InternVL2-40B | Multimodal | Vision-Language | 40.0B | — | 93.8 GB | 94 | — | — | OpenVLM |
| 223 | VILA1.5-40B | Multimodal | Vision-Language | 40.0B | — | 93.8 GB | 73 | — | — | OpenVLM |
| 224 | VITA | Multimodal | Vision-Language | 47.0B | — | 110.2 GB | — | — | — | OpenVLM |
| 225 | 360VL-70B | Multimodal | Vision-Language | 70.0B | — | 164.1 GB | 59 | — | — | OpenVLM |
| 226 | Qwen-VL-Max-0809 | Multimodal | Vision-Language | 72.0B | — | 168.8 GB | 93 | — | — | OpenVLM |
| 227 | UI-TARS-72B (ByteDance) ui-understandinggui-agentelement-grounding | Multimodal | UI Understanding | 72.0B | — | 168.8 GB | 88 | — | Qwen2-VL-72B fine-tuned | Curated |
| 228 | LLaVA-OneVision-72B (SI) | Multimodal | Vision-Language | 73.0B | — | 171.1 GB | — | — | — | OpenVLM |
| 229 | LLaVA-OneVision-72B | Multimodal | Vision-Language | 73.0B | — | 171.1 GB | 91 | — | — | OpenVLM |
| 230 | Molmo-72B | Multimodal | Vision-Language | 73.3B | — | 171.8 GB | — | — | — | OpenVLM |
| 231 | Qwen2-VL-72B | Multimodal | Vision-Language | 73.4B | — | 172.0 GB | 95 | — | — | OpenVLM |
| 232 | Qwen2.5-VL-72B | Multimodal | Vision-Language | 73.4B | — | 172.0 GB | 98 | — | — | OpenVLM |
| 233 | InternVL2-Llama3-76B | Multimodal | Vision-Language | 76.0B | — | 178.1 GB | 93 | — | — | OpenVLM |
| 234 | InternVL2.5-78B | Multimodal | Vision-Language | 78.0B | — | 182.8 GB | 98 | — | — | OpenVLM |
| 235 | InternVL2.5-78B-MPO | Multimodal | Vision-Language | 78.0B | — | 182.8 GB | 99 | — | — | OpenVLM |
| 236 | InternVL3-78B | Multimodal | Vision-Language | 78.4B | — | 183.8 GB | 100 | — | — | OpenVLM |
| 237 | RBDash-v1.5 | Multimodal | Vision-Language | 79.0B | — | 185.2 GB | 88 | — | — | OpenVLM |
| 238 | NVLM-D-72B | Multimodal | Vision-Language | 79.4B | — | 186.1 GB | 65 | — | — | OpenVLM |
| 239 | IDEFICS-80B-Instruct | Multimodal | Vision-Language | 80.0B | — | 187.5 GB | 9 | — | — | OpenVLM |
| 240 | BailingMM-Pro-0120 | Multimodal | Vision-Language | 81.0B | — | 189.8 GB | 96 | — | — | OpenVLM |
| 241 | Llama-3.2-90B-Vision-Instruct | Multimodal | Vision-Language | 88.6B | — | 207.7 GB | 66 | — | — | OpenVLM |
| 242 | GPT-4o (0513, detail-high) | Multimodal | Vision-Language | — | — | — | 83 | — | — | OpenVLM |
| 243 | GPT-4o (0513, detail-low) | Multimodal | Vision-Language | — | — | — | 81 | — | — | OpenVLM |
| 244 | GLM-4v | Multimodal | Vision-Language | — | — | — | 70 | — | — | OpenVLM |
| 245 | GPT-4v (0409, detail-high) | Multimodal | Vision-Language | — | — | — | 70 | — | — | OpenVLM |
| 246 | GPT-4v (0409, detail-low) | Multimodal | Vision-Language | — | — | — | 69 | — | — | OpenVLM |
| 247 | Qwen-VL-Max | Multimodal | Vision-Language | — | — | — | 53 | — | — | OpenVLM |
| 248 | GPT-4v (1106, detail-low) | Multimodal | Vision-Language | — | — | — | 51 | — | — | OpenVLM |
| 249 | RekaFlash | Multimodal | Vision-Language | — | — | — | 50 | — | — | OpenVLM |
| 250 | Gemini-1.0-Pro | Multimodal | Vision-Language | — | — | — | 42 | — | — | OpenVLM |
| 251 | Claude3-Sonnet | Multimodal | Vision-Language | — | — | — | 23 | — | — | OpenVLM |
| 252 | Qwen-VL-Plus | Multimodal | Vision-Language | — | — | — | 21 | — | — | OpenVLM |
| 253 | RekaEdge | Multimodal | Vision-Language | — | — | — | 20 | — | — | OpenVLM |
| 254 | GPT-4v (1106, detail-high) | Multimodal | Vision-Language | — | — | — | 18 | — | — | OpenVLM |
| 255 | Claude3-Opus | Multimodal | Vision-Language | — | — | — | 14 | — | — | OpenVLM |
| 256 | Claude3-Haiku | Multimodal | Vision-Language | — | — | — | 11 | — | — | OpenVLM |
| 257 | Gemini-1.5-Pro | Multimodal | Vision-Language | — | — | — | 43 | — | — | OpenVLM |
| 258 | Claude3.5-Sonnet | Multimodal | Vision-Language | — | — | — | 63 | — | — | OpenVLM |
| 259 | CongRong | Multimodal | Vision-Language | — | — | — | 80 | — | — | OpenVLM |
| 260 | GPT-4o-mini (0718, detail-high) | Multimodal | Vision-Language | — | — | — | 53 | — | — | OpenVLM |
| 261 | Yi-Vision | Multimodal | Vision-Language | — | — | — | 55 | — | — | OpenVLM |
| 262 | GPT-4o (0806, detail-high) | Multimodal | Vision-Language | — | — | — | 75 | — | — | OpenVLM |
| 263 | Step-1.5V | Multimodal | Vision-Language | — | — | — | 90 | — | — | OpenVLM |
| 264 | Gemini-1.5-Flash | Multimodal | Vision-Language | — | — | — | 62 | — | — | OpenVLM |
| 265 | Qwen-VL-Plus-0809 | Multimodal | Vision-Language | — | — | — | 78 | — | — | OpenVLM |
| 266 | Claude3.5-Sonnet-20241022 | Multimodal | Vision-Language | — | — | — | 77 | — | — | OpenVLM |
| 267 | Taiyi | Multimodal | Vision-Language | — | — | — | 93 | — | — | OpenVLM |
| 268 | JT-VL-Chat-V3.0 | Multimodal | Vision-Language | — | — | — | — | — | — | OpenVLM |
| 269 | TeleMM | Multimodal | Vision-Language | — | — | — | — | — | — | OpenVLM |
| 270 | Gemini-1.5-Pro-002 | Multimodal | Vision-Language | — | — | — | — | — | — | OpenVLM |
| 271 | Gemini-1.5-Flash-002 | Multimodal | Vision-Language | — | — | — | — | — | — | OpenVLM |
| 272 | GPT-4o (1120, detail-high) | Multimodal | Vision-Language | — | — | — | — | — | — | OpenVLM |
| 273 | GLM-4v-Plus | Multimodal | Vision-Language | — | — | — | 71 | — | — | OpenVLM |
| 274 | Step-1.5V-mini | Multimodal | Vision-Language | — | — | — | 2 | — | — | OpenVLM |
| 275 | abab6.5s | Multimodal | Vision-Language | — | — | — | 11 | — | — | OpenVLM |
| 276 | abab7-preview | Multimodal | Vision-Language | — | — | — | 87 | — | — | OpenVLM |
| 277 | SenseNova | Multimodal | Vision-Language | — | — | — | — | — | — | OpenVLM |
| 278 | Gemini-2.0-Flash | Multimodal | Vision-Language | — | — | — | — | — | — | OpenVLM |
| 279 | Step-1o | Multimodal | Vision-Language | — | — | — | 99 | — | — | OpenVLM |
| 280 | HunYuan-Standard-Vision | Multimodal | Vision-Language | — | — | — | 92 | — | — | OpenVLM |
| 281 | GLM-4v-Plus-20250111 | Multimodal | Vision-Language | — | — | — | 100 | — | — | OpenVLM |
| 282 | Gemini-2.0-Pro | Multimodal | Vision-Language | — | — | — | 87 | — | — | OpenVLM |
| 283 | Claude3.7-Sonnet | Multimodal | Vision-Language | — | — | — | 71 | — | — | OpenVLM |
| 284 | moonshot-v1-8k | Multimodal | Vision-Language | — | — | — | 61 | — | — | OpenVLM |
| 285 | grok-2-vision-1212 | Multimodal | Vision-Language | — | — | — | 90 | — | — | OpenVLM |
| 286 | GPT-4.5 | Multimodal | Vision-Language | — | — | — | — | — | — | OpenVLM |
| 287 | ChatGPT-4o-latest | Multimodal | Vision-Language | — | — | — | — | — | — | OpenVLM |
| 288 | Gemini-2.5-Pro | Multimodal | Vision-Language | — | — | — | — | — | — | OpenVLM |
| 289 | GPT-4.1-20250414 | Multimodal | Vision-Language | — | — | — | 95 | — | — | OpenVLM |
| 290 | GPT-4.1-mini-20250414 | Multimodal | Vision-Language | — | — | — | 94 | — | — | OpenVLM |
| 291 | GPT-4.1-nano-20250414 | Multimodal | Vision-Language | — | — | — | 24 | — | — | OpenVLM |
| 292 | SenseNova-V6-Pro | Multimodal | Vision-Language | — | — | — | — | — | — | OpenVLM |
| 293 | CongRong-v2.0 | Multimodal | Vision-Language | — | — | — | — | — | — | OpenVLM |
| 294 | GPT-5-20250807 | Multimodal | Vision-Language | — | — | — | — | — | — | OpenVLM |
| 295 | GPT-5-nano-20250807 | Multimodal | Vision-Language | — | — | — | — | — | — | OpenVLM |
| 296 | GPT-5-mini-20250807 | Multimodal | Vision-Language | — | — | — | — | — | — | OpenVLM |
| 297 | SenseNova-V6-5-Pro | Multimodal | Vision-Language | — | — | — | — | — | — | OpenVLM |
| 298 | OmniParser (Microsoft) ui-understandingscreenshot-parsingelement-detection | Multimodal | UI Understanding | — | — | — | 100 | — | Detection + OCR + Icon pipeline | Curated |
| 299 | OmniParser V2 (Microsoft) ui-understandingscreenshot-parsingelement-detection | Multimodal | UI Understanding | — | — | — | — | — | Detection + OCR + Icon pipeline v2 | Curated |