Domain
Task
Showing 32 models
| # | Model | Domain | Task | Params ↑ | GFLOPs | VRAM | Context | Speed | Arch | Source |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Silero-VAD | Speech | voice activity detection | 0.24M | — | 1 MB | — | — | — | Qualcomm AI Hub |
| 2 | YamNet | Speech | Image Classification | 3.73M | — | 9 MB | — | — | — | Qualcomm AI Hub |
| 3 | abr-ai/niagara-9m-batch.en | Speech | Speech Recognition | 9.00M | — | 22 MB | — | 7158 RTFx | State-space model/CTC | Open ASR |
| 4 | abr-ai/niagara-19m-batch.en | Speech | Speech Recognition | 20.0M | — | 48 MB | — | 4324 RTFx | State-space model/CTC | Open ASR |
| 5 | abr-ai/niagara-38m-batch.en | Speech | Speech Recognition | 38.0M | — | 91 MB | — | 4015 RTFx | — | Open ASR |
| 6 | DeepSpeech2 | Speech | Speech | 94.6M | — | 227 MB | — | — | — | Qualcomm AI Hub |
| 7 | HuggingFace-WavLM-Base-Plus | Speech | Speech | 95.1M | — | 228 MB | — | — | — | Qualcomm AI Hub |
| 8 | nvidia/canary-180m-flash | Speech | Speech Recognition | 180.0M | — | 432 MB | — | 2489 RTFx | Conformer-based/Transformer | Open ASR |
| 9 | FunASR-Conformer-EN | Speech | Speech | 220.0M | — | 528 MB | — | — | — | Qualcomm AI Hub |
| 10 | soundsgoodai/Zipformer-cr-ctc-transducer-XL-290M | Speech | Speech Recognition | 290.0M | — | 696 MB | — | 158 RTFx | Zipformer/Pruned Stateless Transducer with k2 modified_beam_search | Open ASR |
| 11 | soundsgoodai/Zipformer-transducer-XL-290M | Speech | Speech Recognition | 290.0M | — | 696 MB | — | 141 RTFx | Zipformer/RNN-T | Open ASR |
| 12 | AutoArk-AI/Audio8-ASR-0.1B | Speech | Speech Recognition | 324.0M | — | 778 MB | — | 719 RTFx | Qwen3-ASR audio encoder/8-layer Qwen-style causal LM | Open ASR |
| 13 | ibm-granite/granite-speech-5.0-470m-turboctc | Speech | Speech Recognition | 470.0M | — | 1.1 GB | — | 12946 RTFx | Streaming-style Conformer/CTC | Open ASR |
| 14 | ibm-granite/granite-speech-5.0-470m-turboctc-nc | Speech | Speech Recognition | 470.0M | — | 1.1 GB | — | 12762 RTFx | Streaming-style Conformer/CTC | Open ASR |
| 15 | nvidia/parakeet-ctc-0.6b | Speech | Speech Recognition | 600.0M | — | 1.4 GB | — | 5870 RTFx | Conformer-based/CTC | Open ASR |
| 16 | nvidia/parakeet-rnnt-0.6b | Speech | Speech Recognition | 600.0M | — | 1.4 GB | — | 5431 RTFx | Conformer-based/TDT / RNN-T | Open ASR |
| 17 | nvidia/parakeet-tdt-0.6b-v2 | Speech | Speech Recognition | 600.0M | — | 1.4 GB | — | 6025 RTFx | Conformer-based/TDT / RNN-T | Open ASR |
| 18 | nvidia/parakeet-tdt-0.6b-v3 | Speech | Speech Recognition | 600.0M | — | 1.4 GB | — | 6076 RTFx | Conformer-based/TDT / RNN-T | Open ASR |
| 19 | nvidia/nemotron-speech-streaming-en-0.6b | Speech | Speech Recognition | 620.0M | — | 1.5 GB | — | 1167 RTFx | FastConformer (cache-aware)/RNNT | Open ASR |
| 20 | nvidia/nemotron-3.5-asr-streaming-0.6b | Speech | Speech Recognition | 640.0M | — | 1.5 GB | — | 1345 RTFx | FastConformer (cache-aware)/RNNT | Open ASR |
| 21 | Qwen/Qwen3-ASR-0.6B-hf | Speech | Speech Recognition | 780.0M | — | 1.8 GB | — | 744 RTFx | Custom/Qwen3 | Open ASR |
| 22 | distil-whisper/distil-large-v3.5 | Speech | Speech Recognition | 800.0M | — | 1.9 GB | — | 879 RTFx | Whisper/Transformer | Open ASR |
| 23 | openai/whisper-large-v3-turbo | Speech | Speech Recognition | 800.0M | — | 1.9 GB | — | 797 RTFx | Whisper/Transformer | Open ASR |
| 24 | FunAudioLLM/Fun-ASR-Nano-2512-hf | Speech | Speech Recognition | 830.0M | — | 1.9 GB | — | 497 RTFx | Qwen3-ASR/Custom | Open ASR |
| 25 | OpenMOSS-Team/MOSS-Transcribe-Diarize | Speech | Speech Recognition | 910.0M | — | 2.1 GB | — | 381 RTFx | "Whisper audio encoder/24 layers" | Open ASR |
| 26 | espnet/owsm_ctc_v4_1B | Speech | Speech Recognition | 1.0B | — | 2.3 GB | — | 777 RTFx | Whisper/CTC | Open ASR |
| 27 | nvidia/canary-1b | Speech | Speech Recognition | 1.0B | — | 2.3 GB | — | 767 RTFx | Conformer-based/Transformer | Open ASR |
| 28 | nvidia/canary-1b-flash | Speech | Speech Recognition | 1.0B | — | 2.3 GB | — | 2129 RTFx | Conformer-based/Transformer | Open ASR |
| 29 | nvidia/canary-1b-v2 | Speech | Speech Recognition | 1.0B | — | 2.3 GB | — | 1825 RTFx | Conformer-based/Transformer | Open ASR |
| 30 | nvidia/parakeet-ctc-1.1b | Speech | Speech Recognition | 1.1B | — | 2.6 GB | — | 5023 RTFx | Conformer-based/CTC | Open ASR |
| 31 | nvidia/parakeet-rnnt-1.1b | Speech | Speech Recognition | 1.1B | — | 2.6 GB | — | 4139 RTFx | Conformer-based/TDT / RNN-T | Open ASR |
| 32 | AutoArk-AI/ARK-ASR-0.6B | Speech | Speech Recognition | 1.1B | — | 2.7 GB | — | 663 RTFx | Whisper/Qwen2 | Open ASR |