context.vn
Menu

Small Model Hub

3,618 efficient AI models across 9 domains · Charts · API

ScoreRaw benchmark score — scale varies by task
Showing 14 models
#ModelDomainTaskParams ↑GFLOPsVRAMScoreSpeedArchSource
1
ShowUI
ui-understandingelement-groundinggui-agent
MultimodalUI Understanding2.0B—4.7 GB
75.1ScreenSpot
—Qwen2-VL-2B + UI-guided token selectionCurated
2
UI-TARS-2B (ByteDance)
ui-understandinggui-agentelement-grounding
MultimodalUI Understanding2.0B—4.7 GB
83.8ScreenSpot
—Qwen2-VL-2B fine-tunedCurated
3
ScreenAI (Google)
ui-understandingscreenshot-qascreen2words
MultimodalUI Understanding5.0B—11.7 GB
——
—PaLI-based VLMCurated
4
Ferret-UI (Apple)
ui-understandingscreenshot-analysiselement-grounding
MultimodalUI Understanding7.0B—16.4 GB
87.0ScreenSpot
—Ferret + any-resolutionCurated
5
Ferret-UI 2 (Apple)
ui-understandingscreenshot-analysiselement-grounding
MultimodalUI Understanding7.0B—16.4 GB
——
—Ferret-UI + multi-platformCurated
6
UI-TARS-7B (ByteDance)
ui-understandinggui-agentelement-grounding
MultimodalUI Understanding7.0B—16.4 GB
90.3ScreenSpot
—Qwen2-VL-7B fine-tunedCurated
7
UGround (UIX-Qwen2-7B)
ui-understandingelement-grounding
MultimodalUI Understanding7.0B—16.4 GB
82.8ScreenSpot
—Qwen2-VL-7B fine-tunedCurated
8
Aguvis-7B
ui-understandinggui-agentelement-grounding
MultimodalUI Understanding7.0B—16.4 GB
——
—Qwen2-VL-7B fine-tunedCurated
9
OS-Atlas-Pro-7B
ui-understandinggui-agentelement-grounding
MultimodalUI Understanding7.0B—16.4 GB
84.6ScreenSpot
—InternVL2-basedCurated
10
SeeClick
ui-understandingelement-groundinggui-agent
MultimodalUI Understanding9.6B—22.5 GB
73.4ScreenSpot
—Qwen-VL + GUI groundingCurated
11
CogAgent
ui-understandinggui-agentscreenshot-analysis
MultimodalUI Understanding18.0B—42.2 GB
——
—CogVLM + high-res cross-moduleCurated
12
UI-TARS-72B (ByteDance)
ui-understandinggui-agentelement-grounding
MultimodalUI Understanding72.0B—168.8 GB
92.6ScreenSpot
—Qwen2-VL-72B fine-tunedCurated
13
OmniParser (Microsoft)
ui-understandingscreenshot-parsingelement-detection
MultimodalUI Understanding———
93.9ScreenSpot
—Detection + OCR + Icon pipelineCurated
14
OmniParser V2 (Microsoft)
ui-understandingscreenshot-parsingelement-detection
MultimodalUI Understanding———
——
—Detection + OCR + Icon pipeline v2Curated