Domain
Task
Showing 24 models
| # | Model | Domain | Task | Params ↑ | GFLOPs | VRAM | Score | Speed | Arch | Source |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Silero-VAD | Speech | voice activity detection | 0.24M | — | 1 MB | —— | — | — | Qualcomm AI Hub |
| 2 | YamNet | Speech | Image Classification | 3.73M | — | 9 MB | —— | — | — | Qualcomm AI Hub |
| 3 | abr-ai/niagara-9m-batch.en | Speech | Speech Recognition | 9.00M | — | 22 MB | —— | 7158 RTFx | State-space model/CTC | Open ASR |
| 4 | abr-ai/niagara-19m-batch.en | Speech | Speech Recognition | 20.0M | — | 48 MB | —— | 4324 RTFx | State-space model/CTC | Open ASR |
| 5 | abr-ai/niagara-38m-batch.en | Speech | Speech Recognition | 38.0M | — | 91 MB | —— | 4015 RTFx | — | Open ASR |
| 6 | DeepSpeech2 | Speech | Speech | 94.6M | — | 227 MB | —— | — | — | Qualcomm AI Hub |
| 7 | HuggingFace-WavLM-Base-Plus | Speech | Speech | 95.1M | — | 228 MB | —— | — | — | Qualcomm AI Hub |
| 8 | nvidia/canary-180m-flash | Speech | Speech Recognition | 180.0M | — | 432 MB | —— | 2489 RTFx | Conformer-based/Transformer | Open ASR |
| 9 | FunASR-Conformer-EN | Speech | Speech | 220.0M | — | 528 MB | —— | — | — | Qualcomm AI Hub |
| 10 | soundsgoodai/Zipformer-cr-ctc-transducer-XL-290M | Speech | Speech Recognition | 290.0M | — | 696 MB | —— | 158 RTFx | Zipformer/Pruned Stateless Transducer with k2 modified_beam_search | Open ASR |
| 11 | soundsgoodai/Zipformer-transducer-XL-290M | Speech | Speech Recognition | 290.0M | — | 696 MB | —— | 141 RTFx | Zipformer/RNN-T | Open ASR |
| 12 | AutoArk-AI/Audio8-ASR-0.1B | Speech | Speech Recognition | 324.0M | — | 778 MB | —— | 719 RTFx | Qwen3-ASR audio encoder/8-layer Qwen-style causal LM | Open ASR |
| 13 | ibm-granite/granite-speech-5.0-470m-turboctc | Speech | Speech Recognition | 470.0M | — | 1.1 GB | —— | 12946 RTFx | Streaming-style Conformer/CTC | Open ASR |
| 14 | ibm-granite/granite-speech-5.0-470m-turboctc-nc | Speech | Speech Recognition | 470.0M | — | 1.1 GB | —— | 12762 RTFx | Streaming-style Conformer/CTC | Open ASR |
| 15 | nvidia/parakeet-ctc-0.6b | Speech | Speech Recognition | 600.0M | — | 1.4 GB | —— | 5870 RTFx | Conformer-based/CTC | Open ASR |
| 16 | nvidia/parakeet-rnnt-0.6b | Speech | Speech Recognition | 600.0M | — | 1.4 GB | —— | 5431 RTFx | Conformer-based/TDT / RNN-T | Open ASR |
| 17 | nvidia/parakeet-tdt-0.6b-v2 | Speech | Speech Recognition | 600.0M | — | 1.4 GB | —— | 6025 RTFx | Conformer-based/TDT / RNN-T | Open ASR |
| 18 | nvidia/parakeet-tdt-0.6b-v3 | Speech | Speech Recognition | 600.0M | — | 1.4 GB | —— | 6076 RTFx | Conformer-based/TDT / RNN-T | Open ASR |
| 19 | nvidia/nemotron-speech-streaming-en-0.6b | Speech | Speech Recognition | 620.0M | — | 1.5 GB | —— | 1167 RTFx | FastConformer (cache-aware)/RNNT | Open ASR |
| 20 | nvidia/nemotron-3.5-asr-streaming-0.6b | Speech | Speech Recognition | 640.0M | — | 1.5 GB | —— | 1345 RTFx | FastConformer (cache-aware)/RNNT | Open ASR |
| 21 | Qwen/Qwen3-ASR-0.6B-hf | Speech | Speech Recognition | 780.0M | — | 1.8 GB | —— | 744 RTFx | Custom/Qwen3 | Open ASR |
| 22 | distil-whisper/distil-large-v3.5 | Speech | Speech Recognition | 800.0M | — | 1.9 GB | —— | 879 RTFx | Whisper/Transformer | Open ASR |
| 23 | openai/whisper-large-v3-turbo | Speech | Speech Recognition | 800.0M | — | 1.9 GB | —— | 797 RTFx | Whisper/Transformer | Open ASR |
| 24 | FunAudioLLM/Fun-ASR-Nano-2512-hf | Speech | Speech Recognition | 830.0M | — | 1.9 GB | —— | 497 RTFx | Qwen3-ASR/Custom | Open ASR |