Domain
Showing 68 models
| # | Model | Domain | Task | Params ↑ | GFLOPs | VRAM | Score | Speed | Arch | Source |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | nvidia/stt_en_conformer_ctc_small | Speech | Speech Recognition | 10.0M | — | 24 MB | —— | 6258 RTFx | Conformer-based/CTC | Open ASR |
| 2 | nvidia/stt_en_conformer_transducer_small | Speech | Speech Recognition | 14.0M | — | 34 MB | —— | 5557 RTFx | Conformer-based/TDT / RNN-T | Open ASR |
| 3 | abr-ai/niagara-19m-batch.en | Speech | Speech Recognition | 20.0M | — | 48 MB | —— | 3735 RTFx | — | Open ASR |
| 4 | usefulsensors/moonshine-streaming-tiny | Speech | Speech Recognition | 30.0M | — | 72 MB | —— | 4375 RTFx | Custom/Transformer | Open ASR |
| 5 | usefulsensors/moonshine-tiny | Speech | Speech Recognition | 30.0M | — | 72 MB | —— | 3733 RTFx | Custom/Transformer | Open ASR |
| 6 | abr-ai/niagara-38m-batch.en | Speech | Speech Recognition | 38.0M | — | 91 MB | —— | 4049 RTFx | — | Open ASR |
| 7 | usefulsensors/moonshine-base | Speech | Speech Recognition | 60.0M | — | 144 MB | —— | 2767 RTFx | Custom/Transformer | Open ASR |
| 8 | facebook/data2vec-audio-base-960h | Speech | Speech Recognition | 90.0M | — | 216 MB | —— | 2930 RTFx | Self-supervised/CTC | Open ASR |
| 9 | facebook/wav2vec2-base-960h | Speech | Speech Recognition | 90.0M | — | 216 MB | —— | 3366 RTFx | Self-supervised/CTC | Open ASR |
| 10 | nvidia/parakeet-tdt_ctc-110m | Speech | Speech Recognition | 110.0M | — | 264 MB | —— | 6119 RTFx | Conformer-based/"CTC | Open ASR |
| 11 | nvidia/stt_en_fastconformer_transducer_large | Speech | Speech Recognition | 110.0M | — | 264 MB | —— | 6033 RTFx | Conformer-based/TDT / RNN-T | Open ASR |
| 12 | nvidia/stt_en_conformer_ctc_large | Speech | Speech Recognition | 120.0M | — | 288 MB | —— | 5732 RTFx | Conformer-based/CTC | Open ASR |
| 13 | nvidia/stt_en_fastconformer_ctc_large | Speech | Speech Recognition | 120.0M | — | 288 MB | —— | 6027 RTFx | Conformer-based/CTC | Open ASR |
| 14 | usefulsensors/moonshine-streaming-small | Speech | Speech Recognition | 120.0M | — | 288 MB | —— | 3206 RTFx | Custom/Transformer | Open ASR |
| 15 | nvidia/canary-180m-flash | Speech | Speech Recognition | 180.0M | — | 432 MB | —— | 2484 RTFx | Conformer-based/Transformer | Open ASR |
| 16 | usefulsensors/moonshine-streaming-medium | Speech | Speech Recognition | 240.0M | — | 576 MB | —— | 2681 RTFx | Custom/Transformer | Open ASR |
| 17 | soundsgoodai/Zipformer-cr-ctc-transducer-XL-290M | Speech | Speech Recognition | 290.0M | — | 696 MB | —— | 160 RTFx | Zipformer/Pruned Stateless Transducer with k2 modified_beam_search | Open ASR |
| 18 | soundsgoodai/Zipformer-transducer-XL-290M | Speech | Speech Recognition | 290.0M | — | 696 MB | —— | 141 RTFx | Zipformer/RNN-T | Open ASR |
| 19 | facebook/wav2vec2-large-robust-ft-libri-960h | Speech | Speech Recognition | 300.0M | — | 720 MB | —— | 3058 RTFx | Self-supervised/CTC | Open ASR |
| 20 | facebook/data2vec-audio-large-960h | Speech | Speech Recognition | 310.0M | — | 744 MB | —— | 2374 RTFx | Self-supervised/CTC | Open ASR |
| 21 | facebook/hubert-large-ls960-ft | Speech | Speech Recognition | 320.0M | — | 768 MB | —— | 3024 RTFx | Self-supervised/CTC | Open ASR |
| 22 | facebook/wav2vec2-large-960h | Speech | Speech Recognition | 320.0M | — | 768 MB | —— | 3614 RTFx | Self-supervised/CTC | Open ASR |
| 23 | facebook/wav2vec2-large-960h-lv60-self | Speech | Speech Recognition | 320.0M | — | 768 MB | —— | 3010 RTFx | Self-supervised/CTC | Open ASR |
| 24 | speechbrain/asr-wav2vec2-librispeech | Speech | Speech Recognition | 320.0M | — | 768 MB | —— | 3628 RTFx | Self-supervised/CTC | Open ASR |
| 25 | AutoArk-AI/Audio8-ASR-0.1B | Speech | Speech Recognition | 324.0M | — | 778 MB | —— | 709 RTFx | Qwen3-ASR audio encoder/8-layer Qwen-style causal LM | Open ASR |
| 26 | speechbrain/asr-conformer-largescaleasr | Speech | Speech Recognition | 480.0M | — | 1.1 GB | —— | 72 RTFx | Conformer-based/"Transformer | Open ASR |
| 27 | facebook/wav2vec2-conformer-rope-large-960h-ft | Speech | Speech Recognition | 600.0M | — | 1.4 GB | —— | 1723 RTFx | "Self-supervised/Conformer-based" | Open ASR |
| 28 | nvidia/parakeet-ctc-0.6b | Speech | Speech Recognition | 600.0M | — | 1.4 GB | —— | 5884 RTFx | Conformer-based/CTC | Open ASR |
| 29 | nvidia/parakeet-rnnt-0.6b | Speech | Speech Recognition | 600.0M | — | 1.4 GB | —— | 5407 RTFx | Conformer-based/TDT / RNN-T | Open ASR |
| 30 | nvidia/parakeet-tdt-0.6b-v2 | Speech | Speech Recognition | 600.0M | — | 1.4 GB | —— | 6038 RTFx | Conformer-based/TDT / RNN-T | Open ASR |
| 31 | nvidia/parakeet-tdt-0.6b-v3 | Speech | Speech Recognition | 600.0M | — | 1.4 GB | —— | 6098 RTFx | Conformer-based/TDT / RNN-T | Open ASR |
| 32 | facebook/wav2vec2-conformer-rel-pos-large-960h-ft | Speech | Speech Recognition | 620.0M | — | 1.5 GB | —— | 1415 RTFx | "Self-supervised/Conformer-based" | Open ASR |
| 33 | nvidia/nemotron-speech-streaming-en-0.6b | Speech | Speech Recognition | 620.0M | — | 1.5 GB | —— | 1071 RTFx | FastConformer (cache-aware)/RNNT | Open ASR |
| 34 | nvidia/nemotron-3.5-asr-streaming-0.6b | Speech | Speech Recognition | 640.0M | — | 1.5 GB | —— | 1490 RTFx | FastConformer (cache-aware)/RNNT | Open ASR |
| 35 | efficient-speech/lite-whisper-large-v3-turbo-acc | Speech | Speech Recognition | 700.0M | — | 1.6 GB | —— | 327 RTFx | Whisper/Transformer | Open ASR |
| 36 | Qwen/Qwen3-ASR-0.6B | Speech | Speech Recognition | 780.0M | — | 1.8 GB | —— | 439 RTFx | Custom/Qwen3 | Open ASR |
| 37 | Qwen/Qwen3-ASR-0.6B-hf | Speech | Speech Recognition | 780.0M | — | 1.8 GB | —— | 730 RTFx | Custom/Qwen3 | Open ASR |
| 38 | distil-whisper/distil-large-v3.5 | Speech | Speech Recognition | 800.0M | — | 1.9 GB | —— | 874 RTFx | Whisper/Transformer | Open ASR |
| 39 | openai/whisper-large-v3-turbo | Speech | Speech Recognition | 800.0M | — | 1.9 GB | —— | 783 RTFx | Whisper/Transformer | Open ASR |
| 40 | facebook/hubert-xlarge-ls960-ft | Speech | Speech Recognition | 960.0M | — | 2.3 GB | —— | 1980 RTFx | Self-supervised/CTC | Open ASR |
| 41 | facebook/mms-1b-all | Speech | Speech Recognition | 960.0M | — | 2.3 GB | —— | 1954 RTFx | Self-supervised/CTC | Open ASR |
| 42 | efficient-speech/lite-whisper-large-v3 | Speech | Speech Recognition | 1.0B | — | 2.3 GB | —— | 212 RTFx | Whisper/Transformer | Open ASR |
| 43 | efficient-speech/lite-whisper-large-v3-acc | Speech | Speech Recognition | 1.0B | — | 2.3 GB | —— | 204 RTFx | Whisper/Transformer | Open ASR |
| 44 | efficient-speech/lite-whisper-large-v3-fast | Speech | Speech Recognition | 1.0B | — | 2.3 GB | —— | 212 RTFx | Whisper/Transformer | Open ASR |
| 45 | espnet/owsm_ctc_v3.2_ft_1B | Speech | Speech Recognition | 1.0B | — | 2.3 GB | —— | 692 RTFx | Whisper/CTC | Open ASR |
| 46 | espnet/owsm_ctc_v4_1B | Speech | Speech Recognition | 1.0B | — | 2.3 GB | —— | 765 RTFx | Whisper/CTC | Open ASR |
| 47 | nvidia/canary-1b | Speech | Speech Recognition | 1.0B | — | 2.3 GB | —— | 766 RTFx | Conformer-based/Transformer | Open ASR |
| 48 | nvidia/canary-1b-flash | Speech | Speech Recognition | 1.0B | — | 2.3 GB | —— | 2126 RTFx | Conformer-based/Transformer | Open ASR |
| 49 | nvidia/canary-1b-v2 | Speech | Speech Recognition | 1.0B | — | 2.3 GB | —— | 1821 RTFx | Conformer-based/Transformer | Open ASR |
| 50 | espnet/owsm_ctc_v3.1_1B | Speech | Speech Recognition | 1.1B | — | 2.6 GB | —— | 816 RTFx | Whisper/CTC | Open ASR |
| 51 | nvidia/parakeet-ctc-1.1b | Speech | Speech Recognition | 1.1B | — | 2.6 GB | —— | 5015 RTFx | Conformer-based/CTC | Open ASR |
| 52 | nvidia/parakeet-rnnt-1.1b | Speech | Speech Recognition | 1.1B | — | 2.6 GB | —— | 4122 RTFx | Conformer-based/TDT / RNN-T | Open ASR |
| 53 | nvidia/parakeet-tdt-1.1b | Speech | Speech Recognition | 1.1B | — | 2.6 GB | —— | 4529 RTFx | Conformer-based/TDT / RNN-T | Open ASR |
| 54 | AutoArk-AI/ARK-ASR-0.6B | Speech | Speech Recognition | 1.1B | — | 2.7 GB | —— | 672 RTFx | Whisper/Qwen2 | Open ASR |
| 55 | CohereLabs/cohere-transcribe-03-2026 | Speech | Speech Recognition | 2.0B | — | 4.7 GB | —— | 916 RTFx | Conformer-based/Transformer | Open ASR |
| 56 | ibm-granite/granite-4.0-1b-speech | Speech | Speech Recognition | 2.0B | — | 4.7 GB | —— | 661 RTFx | Conformer-based/Granite | Open ASR |
| 57 | ibm-granite/granite-speech-4.1-2b | Speech | Speech Recognition | 2.0B | — | 4.7 GB | —— | 547 RTFx | Conformer-based/Granite | Open ASR |
| 58 | ibm-granite/granite-speech-4.1-2b-nar | Speech | Speech Recognition | 2.0B | — | 4.7 GB | —— | 2079 RTFx | Conformer-based/Hybrid CTC-LLM | Open ASR |
| 59 | nyrahealth/CrisperWhisper | Speech | Speech Recognition | 2.0B | — | 4.7 GB | —— | 33 RTFx | Whisper/Transformer | Open ASR |
| 60 | openai/whisper-large-v3 | Speech | Speech Recognition | 2.0B | — | 4.7 GB | —— | 462 RTFx | Whisper/Transformer | Open ASR |
| 61 | zai-org/GLM-ASR-Nano-2512 | Speech | Speech Recognition | 2.0B | — | 4.7 GB | —— | 333 RTFx | Whisper/Llama | Open ASR |
| 62 | Qwen/Qwen3-ASR-1.7B | Speech | Speech Recognition | 2.0B | — | 4.8 GB | —— | 394 RTFx | Custom/Qwen3 | Open ASR |
| 63 | Qwen/Qwen3-ASR-1.7B-hf | Speech | Speech Recognition | 2.0B | — | 4.8 GB | —— | 796 RTFx | Custom/Qwen3 | Open ASR |
| 64 | OpenMOSS-Team/MOSS-Transcribe-preview-2B | Speech | Speech Recognition | 2.4B | — | 5.7 GB | —— | 149 RTFx | Qwen3-Omni-MoE audio encoder/Qwen3 | Open ASR |
| 65 | nvidia/canary-qwen-2.5b | Speech | Speech Recognition | 2.5B | — | 5.9 GB | —— | 861 RTFx | Conformer-based/Qwen2 | Open ASR |
| 66 | kyutai/stt-2.6b-en | Speech | Speech Recognition | 2.6B | — | 6.1 GB | —— | 133 RTFx | Mimi tokenizer/Transformer | Open ASR |
| 67 | bosonai/higgs-audio-v3-stt | Speech | Speech Recognition | 2.7B | — | 6.3 GB | —— | 110 RTFx | Whisper/Qwen3 | Open ASR |
| 68 | ibm-granite/granite-speech-3.3-2b | Speech | Speech Recognition | 3.0B | — | 7.0 GB | —— | 507 RTFx | Conformer-based/Granite | Open ASR |