context.vn
Menu

Small Model Hub

3,618 efficient AI models across 9 domains · Charts · API

ScorePercentile rank within each task — comparable across domains
Showing 14 models
#ModelDomainTaskParams ↑GFLOPsVRAMContextSpeedArchSource
1
ShowUI
ui-understandingelement-groundinggui-agent
MultimodalUI Understanding2.0B—4.7 GB
13
—Qwen2-VL-2B + UI-guided token selectionCurated
2
UI-TARS-2B (ByteDance)
ui-understandinggui-agentelement-grounding
MultimodalUI Understanding2.0B—4.7 GB
38
—Qwen2-VL-2B fine-tunedCurated
3
ScreenAI (Google)
ui-understandingscreenshot-qascreen2words
MultimodalUI Understanding5.0B—11.7 GB——PaLI-based VLMCurated
4
Ferret-UI (Apple)
ui-understandingscreenshot-analysiselement-grounding
MultimodalUI Understanding7.0B—16.4 GB
63
—Ferret + any-resolutionCurated
5
Ferret-UI 2 (Apple)
ui-understandingscreenshot-analysiselement-grounding
MultimodalUI Understanding7.0B—16.4 GB——Ferret-UI + multi-platformCurated
6
UI-TARS-7B (ByteDance)
ui-understandinggui-agentelement-grounding
MultimodalUI Understanding7.0B—16.4 GB
75
—Qwen2-VL-7B fine-tunedCurated
7
UGround (UIX-Qwen2-7B)
ui-understandingelement-grounding
MultimodalUI Understanding7.0B—16.4 GB
25
—Qwen2-VL-7B fine-tunedCurated
8
Aguvis-7B
ui-understandinggui-agentelement-grounding
MultimodalUI Understanding7.0B—16.4 GB——Qwen2-VL-7B fine-tunedCurated
9
OS-Atlas-Pro-7B
ui-understandinggui-agentelement-grounding
MultimodalUI Understanding7.0B—16.4 GB
50
—InternVL2-basedCurated
10
SeeClick
ui-understandingelement-groundinggui-agent
MultimodalUI Understanding9.6B—22.5 GB
0
—Qwen-VL + GUI groundingCurated
11
CogAgent
ui-understandinggui-agentscreenshot-analysis
MultimodalUI Understanding18.0B—42.2 GB——CogVLM + high-res cross-moduleCurated
12
UI-TARS-72B (ByteDance)
ui-understandinggui-agentelement-grounding
MultimodalUI Understanding72.0B—168.8 GB
88
—Qwen2-VL-72B fine-tunedCurated
13
OmniParser (Microsoft)
ui-understandingscreenshot-parsingelement-detection
MultimodalUI Understanding———
100
—Detection + OCR + Icon pipelineCurated
14
OmniParser V2 (Microsoft)
ui-understandingscreenshot-parsingelement-detection
MultimodalUI Understanding—————Detection + OCR + Icon pipeline v2Curated