context.vn

Small Model Hub

3,378 efficient AI models across 7 domains · Charts · API

ScorePercentile rank within each task — comparable across domains
Showing 14 models
#ModelDomainTaskParams ↑GFLOPsVRAMContextSpeedArchSource
1
ShowUI
ui-understandingelement-groundinggui-agent
MultimodalUI Understanding2.0B4.7 GB
13
Qwen2-VL-2B + UI-guided token selectionCurated
2
UI-TARS-2B (ByteDance)
ui-understandinggui-agentelement-grounding
MultimodalUI Understanding2.0B4.7 GB
38
Qwen2-VL-2B fine-tunedCurated
3
ScreenAI (Google)
ui-understandingscreenshot-qascreen2words
MultimodalUI Understanding5.0B11.7 GBPaLI-based VLMCurated
4
Ferret-UI (Apple)
ui-understandingscreenshot-analysiselement-grounding
MultimodalUI Understanding7.0B16.4 GB
63
Ferret + any-resolutionCurated
5
Ferret-UI 2 (Apple)
ui-understandingscreenshot-analysiselement-grounding
MultimodalUI Understanding7.0B16.4 GBFerret-UI + multi-platformCurated
6
UI-TARS-7B (ByteDance)
ui-understandinggui-agentelement-grounding
MultimodalUI Understanding7.0B16.4 GB
75
Qwen2-VL-7B fine-tunedCurated
7
UGround (UIX-Qwen2-7B)
ui-understandingelement-grounding
MultimodalUI Understanding7.0B16.4 GB
25
Qwen2-VL-7B fine-tunedCurated
8
Aguvis-7B
ui-understandinggui-agentelement-grounding
MultimodalUI Understanding7.0B16.4 GBQwen2-VL-7B fine-tunedCurated
9
OS-Atlas-Pro-7B
ui-understandinggui-agentelement-grounding
MultimodalUI Understanding7.0B16.4 GB
50
InternVL2-basedCurated
10
SeeClick
ui-understandingelement-groundinggui-agent
MultimodalUI Understanding9.6B22.5 GB
0
Qwen-VL + GUI groundingCurated
11
CogAgent
ui-understandinggui-agentscreenshot-analysis
MultimodalUI Understanding18.0B42.2 GBCogVLM + high-res cross-moduleCurated
12
UI-TARS-72B (ByteDance)
ui-understandinggui-agentelement-grounding
MultimodalUI Understanding72.0B168.8 GB
88
Qwen2-VL-72B fine-tunedCurated
13
OmniParser (Microsoft)
ui-understandingscreenshot-parsingelement-detection
MultimodalUI Understanding
100
Detection + OCR + Icon pipelineCurated
14
OmniParser V2 (Microsoft)
ui-understandingscreenshot-parsingelement-detection
MultimodalUI UnderstandingDetection + OCR + Icon pipeline v2Curated