Domain
Task
Showing 39 models
| # | Model | Domain | Task | Params ↑ | GFLOPs | VRAM | Score | Speed | Arch | Source |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | abr-ai/niagara-9m-batch.en | Speech | Speech Recognition | 9.00M | — | 22 MB | —— | 7158 RTFx | State-space model/CTC | Open ASR |
| 2 | abr-ai/niagara-19m-batch.en | Speech | Speech Recognition | 20.0M | — | 48 MB | —— | 4324 RTFx | State-space model/CTC | Open ASR |
| 3 | abr-ai/niagara-38m-batch.en | Speech | Speech Recognition | 38.0M | — | 91 MB | —— | 4015 RTFx | — | Open ASR |
| 4 | nvidia/canary-180m-flash | Speech | Speech Recognition | 180.0M | — | 432 MB | —— | 2489 RTFx | Conformer-based/Transformer | Open ASR |
| 5 | soundsgoodai/Zipformer-cr-ctc-transducer-XL-290M | Speech | Speech Recognition | 290.0M | — | 696 MB | —— | 158 RTFx | Zipformer/Pruned Stateless Transducer with k2 modified_beam_search | Open ASR |
| 6 | soundsgoodai/Zipformer-transducer-XL-290M | Speech | Speech Recognition | 290.0M | — | 696 MB | —— | 141 RTFx | Zipformer/RNN-T | Open ASR |
| 7 | AutoArk-AI/Audio8-ASR-0.1B | Speech | Speech Recognition | 324.0M | — | 778 MB | —— | 719 RTFx | Qwen3-ASR audio encoder/8-layer Qwen-style causal LM | Open ASR |
| 8 | ibm-granite/granite-speech-5.0-470m-turboctc | Speech | Speech Recognition | 470.0M | — | 1.1 GB | —— | 12946 RTFx | Streaming-style Conformer/CTC | Open ASR |
| 9 | ibm-granite/granite-speech-5.0-470m-turboctc-nc | Speech | Speech Recognition | 470.0M | — | 1.1 GB | —— | 12762 RTFx | Streaming-style Conformer/CTC | Open ASR |
| 10 | nvidia/parakeet-ctc-0.6b | Speech | Speech Recognition | 600.0M | — | 1.4 GB | —— | 5870 RTFx | Conformer-based/CTC | Open ASR |
| 11 | nvidia/parakeet-rnnt-0.6b | Speech | Speech Recognition | 600.0M | — | 1.4 GB | —— | 5431 RTFx | Conformer-based/TDT / RNN-T | Open ASR |
| 12 | nvidia/parakeet-tdt-0.6b-v2 | Speech | Speech Recognition | 600.0M | — | 1.4 GB | —— | 6025 RTFx | Conformer-based/TDT / RNN-T | Open ASR |
| 13 | nvidia/parakeet-tdt-0.6b-v3 | Speech | Speech Recognition | 600.0M | — | 1.4 GB | —— | 6076 RTFx | Conformer-based/TDT / RNN-T | Open ASR |
| 14 | nvidia/nemotron-speech-streaming-en-0.6b | Speech | Speech Recognition | 620.0M | — | 1.5 GB | —— | 1167 RTFx | FastConformer (cache-aware)/RNNT | Open ASR |
| 15 | nvidia/nemotron-3.5-asr-streaming-0.6b | Speech | Speech Recognition | 640.0M | — | 1.5 GB | —— | 1345 RTFx | FastConformer (cache-aware)/RNNT | Open ASR |
| 16 | Qwen/Qwen3-ASR-0.6B-hf | Speech | Speech Recognition | 780.0M | — | 1.8 GB | —— | 744 RTFx | Custom/Qwen3 | Open ASR |
| 17 | distil-whisper/distil-large-v3.5 | Speech | Speech Recognition | 800.0M | — | 1.9 GB | —— | 879 RTFx | Whisper/Transformer | Open ASR |
| 18 | openai/whisper-large-v3-turbo | Speech | Speech Recognition | 800.0M | — | 1.9 GB | —— | 797 RTFx | Whisper/Transformer | Open ASR |
| 19 | FunAudioLLM/Fun-ASR-Nano-2512-hf | Speech | Speech Recognition | 830.0M | — | 1.9 GB | —— | 497 RTFx | Qwen3-ASR/Custom | Open ASR |
| 20 | OpenMOSS-Team/MOSS-Transcribe-Diarize | Speech | Speech Recognition | 910.0M | — | 2.1 GB | —— | 381 RTFx | "Whisper audio encoder/24 layers" | Open ASR |
| 21 | espnet/owsm_ctc_v4_1B | Speech | Speech Recognition | 1.0B | — | 2.3 GB | —— | 777 RTFx | Whisper/CTC | Open ASR |
| 22 | nvidia/canary-1b | Speech | Speech Recognition | 1.0B | — | 2.3 GB | —— | 767 RTFx | Conformer-based/Transformer | Open ASR |
| 23 | nvidia/canary-1b-flash | Speech | Speech Recognition | 1.0B | — | 2.3 GB | —— | 2129 RTFx | Conformer-based/Transformer | Open ASR |
| 24 | nvidia/canary-1b-v2 | Speech | Speech Recognition | 1.0B | — | 2.3 GB | —— | 1825 RTFx | Conformer-based/Transformer | Open ASR |
| 25 | nvidia/parakeet-ctc-1.1b | Speech | Speech Recognition | 1.1B | — | 2.6 GB | —— | 5023 RTFx | Conformer-based/CTC | Open ASR |
| 26 | nvidia/parakeet-rnnt-1.1b | Speech | Speech Recognition | 1.1B | — | 2.6 GB | —— | 4139 RTFx | Conformer-based/TDT / RNN-T | Open ASR |
| 27 | AutoArk-AI/ARK-ASR-0.6B | Speech | Speech Recognition | 1.1B | — | 2.7 GB | —— | 663 RTFx | Whisper/Qwen2 | Open ASR |
| 28 | CohereLabs/cohere-transcribe-03-2026 | Speech | Speech Recognition | 2.0B | — | 4.7 GB | —— | 907 RTFx | Conformer-based/Transformer | Open ASR |
| 29 | ibm-granite/granite-4.0-1b-speech | Speech | Speech Recognition | 2.0B | — | 4.7 GB | —— | 666 RTFx | Conformer-based/Granite | Open ASR |
| 30 | ibm-granite/granite-speech-4.1-2b | Speech | Speech Recognition | 2.0B | — | 4.7 GB | —— | 546 RTFx | Conformer-based/Granite | Open ASR |
| 31 | ibm-granite/granite-speech-4.1-2b-nar | Speech | Speech Recognition | 2.0B | — | 4.7 GB | —— | 2074 RTFx | Conformer-based/Hybrid CTC-LLM | Open ASR |
| 32 | openai/whisper-large-v3 | Speech | Speech Recognition | 2.0B | — | 4.7 GB | —— | 470 RTFx | Whisper/Transformer | Open ASR |
| 33 | zai-org/GLM-ASR-Nano-2512 | Speech | Speech Recognition | 2.0B | — | 4.7 GB | —— | 334 RTFx | Whisper/Llama | Open ASR |
| 34 | Qwen/Qwen3-ASR-1.7B-hf | Speech | Speech Recognition | 2.0B | — | 4.8 GB | —— | 820 RTFx | Custom/Qwen3 | Open ASR |
| 35 | OpenMOSS-Team/MOSS-Transcribe-preview-2B | Speech | Speech Recognition | 2.4B | — | 5.7 GB | —— | 151 RTFx | Qwen3-Omni-MoE audio encoder/Qwen3 | Open ASR |
| 36 | nvidia/canary-qwen-2.5b | Speech | Speech Recognition | 2.5B | — | 5.9 GB | —— | 867 RTFx | Conformer-based/Qwen2 | Open ASR |
| 37 | kyutai/stt-2.6b-en | Speech | Speech Recognition | 2.6B | — | 6.1 GB | —— | 133 RTFx | Mimi tokenizer/Transformer | Open ASR |
| 38 | bosonai/higgs-audio-v3-stt | Speech | Speech Recognition | 2.7B | — | 6.3 GB | —— | 111 RTFx | Whisper/Qwen3 | Open ASR |
| 39 | ibm-granite/granite-speech-3.3-2b | Speech | Speech Recognition | 3.0B | — | 7.0 GB | —— | 509 RTFx | Conformer-based/Granite | Open ASR |