context.vn

Small Model Hub

3,378 efficient AI models across 7 domains · Charts · API

ScoreRaw benchmark score — scale varies by task
Showing 14 models
#ModelDomainTaskParams ↑GFLOPsVRAMScoreSpeedArchSource
1
ShowUI
ui-understandingelement-groundinggui-agent
MultimodalUI Understanding2.0B4.7 GB
75.1ScreenSpot
Qwen2-VL-2B + UI-guided token selectionCurated
2
UI-TARS-2B (ByteDance)
ui-understandinggui-agentelement-grounding
MultimodalUI Understanding2.0B4.7 GB
83.8ScreenSpot
Qwen2-VL-2B fine-tunedCurated
3
ScreenAI (Google)
ui-understandingscreenshot-qascreen2words
MultimodalUI Understanding5.0B11.7 GB
PaLI-based VLMCurated
4
Ferret-UI (Apple)
ui-understandingscreenshot-analysiselement-grounding
MultimodalUI Understanding7.0B16.4 GB
87.0ScreenSpot
Ferret + any-resolutionCurated
5
Ferret-UI 2 (Apple)
ui-understandingscreenshot-analysiselement-grounding
MultimodalUI Understanding7.0B16.4 GB
Ferret-UI + multi-platformCurated
6
UI-TARS-7B (ByteDance)
ui-understandinggui-agentelement-grounding
MultimodalUI Understanding7.0B16.4 GB
90.3ScreenSpot
Qwen2-VL-7B fine-tunedCurated
7
UGround (UIX-Qwen2-7B)
ui-understandingelement-grounding
MultimodalUI Understanding7.0B16.4 GB
82.8ScreenSpot
Qwen2-VL-7B fine-tunedCurated
8
Aguvis-7B
ui-understandinggui-agentelement-grounding
MultimodalUI Understanding7.0B16.4 GB
Qwen2-VL-7B fine-tunedCurated
9
OS-Atlas-Pro-7B
ui-understandinggui-agentelement-grounding
MultimodalUI Understanding7.0B16.4 GB
84.6ScreenSpot
InternVL2-basedCurated
10
SeeClick
ui-understandingelement-groundinggui-agent
MultimodalUI Understanding9.6B22.5 GB
73.4ScreenSpot
Qwen-VL + GUI groundingCurated
11
CogAgent
ui-understandinggui-agentscreenshot-analysis
MultimodalUI Understanding18.0B42.2 GB
CogVLM + high-res cross-moduleCurated
12
UI-TARS-72B (ByteDance)
ui-understandinggui-agentelement-grounding
MultimodalUI Understanding72.0B168.8 GB
92.6ScreenSpot
Qwen2-VL-72B fine-tunedCurated
13
OmniParser (Microsoft)
ui-understandingscreenshot-parsingelement-detection
MultimodalUI Understanding
93.9ScreenSpot
Detection + OCR + Icon pipelineCurated
14
OmniParser V2 (Microsoft)
ui-understandingscreenshot-parsingelement-detection
MultimodalUI Understanding
Detection + OCR + Icon pipeline v2Curated