Domain
Task
All TasksImage Classification (1,593)3D Object Detection (743)Text Embedding (472)Vision-Language (285)Code Generation (125)Object Detection (106)Speech Recognition (67)Video Understanding (49)Text Generation (48)Segmentation (34)UI Understanding (14)Speech (13)Pose Estimation (11)Super Resolution (10)driver assistance (9)Font Identification (7)image editing (6)Depth Estimation (6)audio generation (6)image generation (4)robotics (3)image to text (2)video object tracking (2)gaze estimation (1)video generation (1)voice activity detection (1)
Showing 39 models
| # | Model | Domain | Task | Params ↑ | GFLOPs | VRAM | Score | Speed | Arch | Source |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | abr-ai/niagara-9m-batch.en | Speech | Speech Recognition | 9.00M | — | 22 MB | —— | 7158 RTFx | State-space model/CTC | Open ASR |
| 2 | abr-ai/niagara-19m-batch.en | Speech | Speech Recognition | 20.0M | — | 48 MB | —— | 4324 RTFx | State-space model/CTC | Open ASR |
| 3 | abr-ai/niagara-38m-batch.en | Speech | Speech Recognition | 38.0M | — | 91 MB | —— | 4015 RTFx | — | Open ASR |
| 4 | nvidia/canary-180m-flash | Speech | Speech Recognition | 180.0M | — | 432 MB | —— | 2489 RTFx | Conformer-based/Transformer | Open ASR |
| 5 | soundsgoodai/Zipformer-cr-ctc-transducer-XL-290M | Speech | Speech Recognition | 290.0M | — | 696 MB | —— | 158 RTFx | Zipformer/Pruned Stateless Transducer with k2 modified_beam_search | Open ASR |
| 6 | soundsgoodai/Zipformer-transducer-XL-290M | Speech | Speech Recognition | 290.0M | — | 696 MB | —— | 141 RTFx | Zipformer/RNN-T | Open ASR |
| 7 | AutoArk-AI/Audio8-ASR-0.1B | Speech | Speech Recognition | 324.0M | — | 778 MB | —— | 719 RTFx | Qwen3-ASR audio encoder/8-layer Qwen-style causal LM | Open ASR |
| 8 | ibm-granite/granite-speech-5.0-470m-turboctc | Speech | Speech Recognition | 470.0M | — | 1.1 GB | —— | 12946 RTFx | Streaming-style Conformer/CTC | Open ASR |
| 9 | ibm-granite/granite-speech-5.0-470m-turboctc-nc | Speech | Speech Recognition | 470.0M | — | 1.1 GB | —— | 12762 RTFx | Streaming-style Conformer/CTC | Open ASR |
| 10 | nvidia/parakeet-ctc-0.6b | Speech | Speech Recognition | 600.0M | — | 1.4 GB | —— | 5870 RTFx | Conformer-based/CTC | Open ASR |
| 11 | nvidia/parakeet-rnnt-0.6b | Speech | Speech Recognition | 600.0M | — | 1.4 GB | —— | 5431 RTFx | Conformer-based/TDT / RNN-T | Open ASR |
| 12 | nvidia/parakeet-tdt-0.6b-v2 | Speech | Speech Recognition | 600.0M | — | 1.4 GB | —— | 6025 RTFx | Conformer-based/TDT / RNN-T | Open ASR |
| 13 | nvidia/parakeet-tdt-0.6b-v3 | Speech | Speech Recognition | 600.0M | — | 1.4 GB | —— | 6076 RTFx | Conformer-based/TDT / RNN-T | Open ASR |
| 14 | nvidia/nemotron-speech-streaming-en-0.6b | Speech | Speech Recognition | 620.0M | — | 1.5 GB | —— | 1167 RTFx | FastConformer (cache-aware)/RNNT | Open ASR |
| 15 | nvidia/nemotron-3.5-asr-streaming-0.6b | Speech | Speech Recognition | 640.0M | — | 1.5 GB | —— | 1345 RTFx | FastConformer (cache-aware)/RNNT | Open ASR |
| 16 | Qwen/Qwen3-ASR-0.6B-hf | Speech | Speech Recognition | 780.0M | — | 1.8 GB | —— | 744 RTFx | Custom/Qwen3 | Open ASR |
| 17 | distil-whisper/distil-large-v3.5 | Speech | Speech Recognition | 800.0M | — | 1.9 GB | —— | 879 RTFx | Whisper/Transformer | Open ASR |
| 18 | openai/whisper-large-v3-turbo | Speech | Speech Recognition | 800.0M | — | 1.9 GB | —— | 797 RTFx | Whisper/Transformer | Open ASR |
| 19 | FunAudioLLM/Fun-ASR-Nano-2512-hf | Speech | Speech Recognition | 830.0M | — | 1.9 GB | —— | 497 RTFx | Qwen3-ASR/Custom | Open ASR |
| 20 | OpenMOSS-Team/MOSS-Transcribe-Diarize | Speech | Speech Recognition | 910.0M | — | 2.1 GB | —— | 381 RTFx | "Whisper audio encoder/24 layers" | Open ASR |
| 21 | espnet/owsm_ctc_v4_1B | Speech | Speech Recognition | 1.0B | — | 2.3 GB | —— | 777 RTFx | Whisper/CTC | Open ASR |
| 22 | nvidia/canary-1b | Speech | Speech Recognition | 1.0B | — | 2.3 GB | —— | 767 RTFx | Conformer-based/Transformer | Open ASR |
| 23 | nvidia/canary-1b-flash | Speech | Speech Recognition | 1.0B | — | 2.3 GB | —— | 2129 RTFx | Conformer-based/Transformer | Open ASR |
| 24 | nvidia/canary-1b-v2 | Speech | Speech Recognition | 1.0B | — | 2.3 GB | —— | 1825 RTFx | Conformer-based/Transformer | Open ASR |
| 25 | nvidia/parakeet-ctc-1.1b | Speech | Speech Recognition | 1.1B | — | 2.6 GB | —— | 5023 RTFx | Conformer-based/CTC | Open ASR |
| 26 | nvidia/parakeet-rnnt-1.1b | Speech | Speech Recognition | 1.1B | — | 2.6 GB | —— | 4139 RTFx | Conformer-based/TDT / RNN-T | Open ASR |
| 27 | AutoArk-AI/ARK-ASR-0.6B | Speech | Speech Recognition | 1.1B | — | 2.7 GB | —— | 663 RTFx | Whisper/Qwen2 | Open ASR |
| 28 | CohereLabs/cohere-transcribe-03-2026 | Speech | Speech Recognition | 2.0B | — | 4.7 GB | —— | 907 RTFx | Conformer-based/Transformer | Open ASR |
| 29 | ibm-granite/granite-4.0-1b-speech | Speech | Speech Recognition | 2.0B | — | 4.7 GB | —— | 666 RTFx | Conformer-based/Granite | Open ASR |
| 30 | ibm-granite/granite-speech-4.1-2b | Speech | Speech Recognition | 2.0B | — | 4.7 GB | —— | 546 RTFx | Conformer-based/Granite | Open ASR |
| 31 | ibm-granite/granite-speech-4.1-2b-nar | Speech | Speech Recognition | 2.0B | — | 4.7 GB | —— | 2074 RTFx | Conformer-based/Hybrid CTC-LLM | Open ASR |
| 32 | openai/whisper-large-v3 | Speech | Speech Recognition | 2.0B | — | 4.7 GB | —— | 470 RTFx | Whisper/Transformer | Open ASR |
| 33 | zai-org/GLM-ASR-Nano-2512 | Speech | Speech Recognition | 2.0B | — | 4.7 GB | —— | 334 RTFx | Whisper/Llama | Open ASR |
| 34 | Qwen/Qwen3-ASR-1.7B-hf | Speech | Speech Recognition | 2.0B | — | 4.8 GB | —— | 820 RTFx | Custom/Qwen3 | Open ASR |
| 35 | OpenMOSS-Team/MOSS-Transcribe-preview-2B | Speech | Speech Recognition | 2.4B | — | 5.7 GB | —— | 151 RTFx | Qwen3-Omni-MoE audio encoder/Qwen3 | Open ASR |
| 36 | nvidia/canary-qwen-2.5b | Speech | Speech Recognition | 2.5B | — | 5.9 GB | —— | 867 RTFx | Conformer-based/Qwen2 | Open ASR |
| 37 | kyutai/stt-2.6b-en | Speech | Speech Recognition | 2.6B | — | 6.1 GB | —— | 133 RTFx | Mimi tokenizer/Transformer | Open ASR |
| 38 | bosonai/higgs-audio-v3-stt | Speech | Speech Recognition | 2.7B | — | 6.3 GB | —— | 111 RTFx | Whisper/Qwen3 | Open ASR |
| 39 | ibm-granite/granite-speech-3.3-2b | Speech | Speech Recognition | 3.0B | — | 7.0 GB | —— | 509 RTFx | Conformer-based/Granite | Open ASR |