Domain
Showing 91 models
| # | Model | Domain | Task | Params ↑ | GFLOPs | VRAM | Score | Speed | Arch | Source |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | nvidia/stt_en_conformer_ctc_small | Speech | Speech Recognition | 10.0M | — | 24 MB | —— | 6258 RTFx | Conformer-based/CTC | Open ASR |
| 2 | nvidia/stt_en_conformer_transducer_small | Speech | Speech Recognition | 14.0M | — | 34 MB | —— | 5557 RTFx | Conformer-based/TDT / RNN-T | Open ASR |
| 3 | abr-ai/niagara-19m-batch.en | Speech | Speech Recognition | 20.0M | — | 48 MB | —— | 3735 RTFx | — | Open ASR |
| 4 | usefulsensors/moonshine-streaming-tiny | Speech | Speech Recognition | 30.0M | — | 72 MB | —— | 4375 RTFx | Custom/Transformer | Open ASR |
| 5 | usefulsensors/moonshine-tiny | Speech | Speech Recognition | 30.0M | — | 72 MB | —— | 3733 RTFx | Custom/Transformer | Open ASR |
| 6 | abr-ai/niagara-38m-batch.en | Speech | Speech Recognition | 38.0M | — | 91 MB | —— | 4049 RTFx | — | Open ASR |
| 7 | usefulsensors/moonshine-base | Speech | Speech Recognition | 60.0M | — | 144 MB | —— | 2767 RTFx | Custom/Transformer | Open ASR |
| 8 | facebook/data2vec-audio-base-960h | Speech | Speech Recognition | 90.0M | — | 216 MB | —— | 2930 RTFx | Self-supervised/CTC | Open ASR |
| 9 | facebook/wav2vec2-base-960h | Speech | Speech Recognition | 90.0M | — | 216 MB | —— | 3366 RTFx | Self-supervised/CTC | Open ASR |
| 10 | nvidia/parakeet-tdt_ctc-110m | Speech | Speech Recognition | 110.0M | — | 264 MB | —— | 6119 RTFx | Conformer-based/"CTC | Open ASR |
| 11 | nvidia/stt_en_fastconformer_transducer_large | Speech | Speech Recognition | 110.0M | — | 264 MB | —— | 6033 RTFx | Conformer-based/TDT / RNN-T | Open ASR |
| 12 | nvidia/stt_en_conformer_ctc_large | Speech | Speech Recognition | 120.0M | — | 288 MB | —— | 5732 RTFx | Conformer-based/CTC | Open ASR |
| 13 | nvidia/stt_en_fastconformer_ctc_large | Speech | Speech Recognition | 120.0M | — | 288 MB | —— | 6027 RTFx | Conformer-based/CTC | Open ASR |
| 14 | usefulsensors/moonshine-streaming-small | Speech | Speech Recognition | 120.0M | — | 288 MB | —— | 3206 RTFx | Custom/Transformer | Open ASR |
| 15 | nvidia/canary-180m-flash | Speech | Speech Recognition | 180.0M | — | 432 MB | —— | 2484 RTFx | Conformer-based/Transformer | Open ASR |
| 16 | usefulsensors/moonshine-streaming-medium | Speech | Speech Recognition | 240.0M | — | 576 MB | —— | 2681 RTFx | Custom/Transformer | Open ASR |
| 17 | soundsgoodai/Zipformer-cr-ctc-transducer-XL-290M | Speech | Speech Recognition | 290.0M | — | 696 MB | —— | 160 RTFx | Zipformer/Pruned Stateless Transducer with k2 modified_beam_search | Open ASR |
| 18 | soundsgoodai/Zipformer-transducer-XL-290M | Speech | Speech Recognition | 290.0M | — | 696 MB | —— | 141 RTFx | Zipformer/RNN-T | Open ASR |
| 19 | facebook/wav2vec2-large-robust-ft-libri-960h | Speech | Speech Recognition | 300.0M | — | 720 MB | —— | 3058 RTFx | Self-supervised/CTC | Open ASR |
| 20 | facebook/data2vec-audio-large-960h | Speech | Speech Recognition | 310.0M | — | 744 MB | —— | 2374 RTFx | Self-supervised/CTC | Open ASR |
| 21 | facebook/hubert-large-ls960-ft | Speech | Speech Recognition | 320.0M | — | 768 MB | —— | 3024 RTFx | Self-supervised/CTC | Open ASR |
| 22 | facebook/wav2vec2-large-960h | Speech | Speech Recognition | 320.0M | — | 768 MB | —— | 3614 RTFx | Self-supervised/CTC | Open ASR |
| 23 | facebook/wav2vec2-large-960h-lv60-self | Speech | Speech Recognition | 320.0M | — | 768 MB | —— | 3010 RTFx | Self-supervised/CTC | Open ASR |
| 24 | speechbrain/asr-wav2vec2-librispeech | Speech | Speech Recognition | 320.0M | — | 768 MB | —— | 3628 RTFx | Self-supervised/CTC | Open ASR |
| 25 | AutoArk-AI/Audio8-ASR-0.1B | Speech | Speech Recognition | 324.0M | — | 778 MB | —— | 709 RTFx | Qwen3-ASR audio encoder/8-layer Qwen-style causal LM | Open ASR |
| 26 | speechbrain/asr-conformer-largescaleasr | Speech | Speech Recognition | 480.0M | — | 1.1 GB | —— | 72 RTFx | Conformer-based/"Transformer | Open ASR |
| 27 | facebook/wav2vec2-conformer-rope-large-960h-ft | Speech | Speech Recognition | 600.0M | — | 1.4 GB | —— | 1723 RTFx | "Self-supervised/Conformer-based" | Open ASR |
| 28 | nvidia/parakeet-ctc-0.6b | Speech | Speech Recognition | 600.0M | — | 1.4 GB | —— | 5884 RTFx | Conformer-based/CTC | Open ASR |
| 29 | nvidia/parakeet-rnnt-0.6b | Speech | Speech Recognition | 600.0M | — | 1.4 GB | —— | 5407 RTFx | Conformer-based/TDT / RNN-T | Open ASR |
| 30 | nvidia/parakeet-tdt-0.6b-v2 | Speech | Speech Recognition | 600.0M | — | 1.4 GB | —— | 6038 RTFx | Conformer-based/TDT / RNN-T | Open ASR |
| 31 | nvidia/parakeet-tdt-0.6b-v3 | Speech | Speech Recognition | 600.0M | — | 1.4 GB | —— | 6098 RTFx | Conformer-based/TDT / RNN-T | Open ASR |
| 32 | facebook/wav2vec2-conformer-rel-pos-large-960h-ft | Speech | Speech Recognition | 620.0M | — | 1.5 GB | —— | 1415 RTFx | "Self-supervised/Conformer-based" | Open ASR |
| 33 | nvidia/nemotron-speech-streaming-en-0.6b | Speech | Speech Recognition | 620.0M | — | 1.5 GB | —— | 1071 RTFx | FastConformer (cache-aware)/RNNT | Open ASR |
| 34 | nvidia/nemotron-3.5-asr-streaming-0.6b | Speech | Speech Recognition | 640.0M | — | 1.5 GB | —— | 1490 RTFx | FastConformer (cache-aware)/RNNT | Open ASR |
| 35 | efficient-speech/lite-whisper-large-v3-turbo-acc | Speech | Speech Recognition | 700.0M | — | 1.6 GB | —— | 327 RTFx | Whisper/Transformer | Open ASR |
| 36 | Qwen/Qwen3-ASR-0.6B | Speech | Speech Recognition | 780.0M | — | 1.8 GB | —— | 439 RTFx | Custom/Qwen3 | Open ASR |
| 37 | Qwen/Qwen3-ASR-0.6B-hf | Speech | Speech Recognition | 780.0M | — | 1.8 GB | —— | 730 RTFx | Custom/Qwen3 | Open ASR |
| 38 | distil-whisper/distil-large-v3.5 | Speech | Speech Recognition | 800.0M | — | 1.9 GB | —— | 874 RTFx | Whisper/Transformer | Open ASR |
| 39 | openai/whisper-large-v3-turbo | Speech | Speech Recognition | 800.0M | — | 1.9 GB | —— | 783 RTFx | Whisper/Transformer | Open ASR |
| 40 | facebook/hubert-xlarge-ls960-ft | Speech | Speech Recognition | 960.0M | — | 2.3 GB | —— | 1980 RTFx | Self-supervised/CTC | Open ASR |
| 41 | facebook/mms-1b-all | Speech | Speech Recognition | 960.0M | — | 2.3 GB | —— | 1954 RTFx | Self-supervised/CTC | Open ASR |
| 42 | efficient-speech/lite-whisper-large-v3 | Speech | Speech Recognition | 1.0B | — | 2.3 GB | —— | 212 RTFx | Whisper/Transformer | Open ASR |
| 43 | efficient-speech/lite-whisper-large-v3-acc | Speech | Speech Recognition | 1.0B | — | 2.3 GB | —— | 204 RTFx | Whisper/Transformer | Open ASR |
| 44 | efficient-speech/lite-whisper-large-v3-fast | Speech | Speech Recognition | 1.0B | — | 2.3 GB | —— | 212 RTFx | Whisper/Transformer | Open ASR |
| 45 | espnet/owsm_ctc_v3.2_ft_1B | Speech | Speech Recognition | 1.0B | — | 2.3 GB | —— | 692 RTFx | Whisper/CTC | Open ASR |
| 46 | espnet/owsm_ctc_v4_1B | Speech | Speech Recognition | 1.0B | — | 2.3 GB | —— | 765 RTFx | Whisper/CTC | Open ASR |
| 47 | nvidia/canary-1b | Speech | Speech Recognition | 1.0B | — | 2.3 GB | —— | 766 RTFx | Conformer-based/Transformer | Open ASR |
| 48 | nvidia/canary-1b-flash | Speech | Speech Recognition | 1.0B | — | 2.3 GB | —— | 2126 RTFx | Conformer-based/Transformer | Open ASR |
| 49 | nvidia/canary-1b-v2 | Speech | Speech Recognition | 1.0B | — | 2.3 GB | —— | 1821 RTFx | Conformer-based/Transformer | Open ASR |
| 50 | espnet/owsm_ctc_v3.1_1B | Speech | Speech Recognition | 1.1B | — | 2.6 GB | —— | 816 RTFx | Whisper/CTC | Open ASR |
| 51 | nvidia/parakeet-ctc-1.1b | Speech | Speech Recognition | 1.1B | — | 2.6 GB | —— | 5015 RTFx | Conformer-based/CTC | Open ASR |
| 52 | nvidia/parakeet-rnnt-1.1b | Speech | Speech Recognition | 1.1B | — | 2.6 GB | —— | 4122 RTFx | Conformer-based/TDT / RNN-T | Open ASR |
| 53 | nvidia/parakeet-tdt-1.1b | Speech | Speech Recognition | 1.1B | — | 2.6 GB | —— | 4529 RTFx | Conformer-based/TDT / RNN-T | Open ASR |
| 54 | AutoArk-AI/ARK-ASR-0.6B | Speech | Speech Recognition | 1.1B | — | 2.7 GB | —— | 672 RTFx | Whisper/Qwen2 | Open ASR |
| 55 | CohereLabs/cohere-transcribe-03-2026 | Speech | Speech Recognition | 2.0B | — | 4.7 GB | —— | 916 RTFx | Conformer-based/Transformer | Open ASR |
| 56 | ibm-granite/granite-4.0-1b-speech | Speech | Speech Recognition | 2.0B | — | 4.7 GB | —— | 661 RTFx | Conformer-based/Granite | Open ASR |
| 57 | ibm-granite/granite-speech-4.1-2b | Speech | Speech Recognition | 2.0B | — | 4.7 GB | —— | 547 RTFx | Conformer-based/Granite | Open ASR |
| 58 | ibm-granite/granite-speech-4.1-2b-nar | Speech | Speech Recognition | 2.0B | — | 4.7 GB | —— | 2079 RTFx | Conformer-based/Hybrid CTC-LLM | Open ASR |
| 59 | nyrahealth/CrisperWhisper | Speech | Speech Recognition | 2.0B | — | 4.7 GB | —— | 33 RTFx | Whisper/Transformer | Open ASR |
| 60 | openai/whisper-large-v3 | Speech | Speech Recognition | 2.0B | — | 4.7 GB | —— | 462 RTFx | Whisper/Transformer | Open ASR |
| 61 | zai-org/GLM-ASR-Nano-2512 | Speech | Speech Recognition | 2.0B | — | 4.7 GB | —— | 333 RTFx | Whisper/Llama | Open ASR |
| 62 | Qwen/Qwen3-ASR-1.7B | Speech | Speech Recognition | 2.0B | — | 4.8 GB | —— | 394 RTFx | Custom/Qwen3 | Open ASR |
| 63 | Qwen/Qwen3-ASR-1.7B-hf | Speech | Speech Recognition | 2.0B | — | 4.8 GB | —— | 796 RTFx | Custom/Qwen3 | Open ASR |
| 64 | OpenMOSS-Team/MOSS-Transcribe-preview-2B | Speech | Speech Recognition | 2.4B | — | 5.7 GB | —— | 149 RTFx | Qwen3-Omni-MoE audio encoder/Qwen3 | Open ASR |
| 65 | nvidia/canary-qwen-2.5b | Speech | Speech Recognition | 2.5B | — | 5.9 GB | —— | 861 RTFx | Conformer-based/Qwen2 | Open ASR |
| 66 | kyutai/stt-2.6b-en | Speech | Speech Recognition | 2.6B | — | 6.1 GB | —— | 133 RTFx | Mimi tokenizer/Transformer | Open ASR |
| 67 | bosonai/higgs-audio-v3-stt | Speech | Speech Recognition | 2.7B | — | 6.3 GB | —— | 110 RTFx | Whisper/Qwen3 | Open ASR |
| 68 | ibm-granite/granite-speech-3.3-2b | Speech | Speech Recognition | 3.0B | — | 7.0 GB | —— | 507 RTFx | Conformer-based/Granite | Open ASR |
| 69 | AutoArk-AI/ARK-ASR-3B | Speech | Speech Recognition | 3.8B | — | 8.8 GB | —— | 484 RTFx | Whisper/Qwen2 | Open ASR |
| 70 | mistralai/Voxtral-Mini-4B-Realtime-2602 | Speech | Speech Recognition | 4.0B | — | 9.4 GB | —— | 105 RTFx | Custom/Transformer | Open ASR |
| 71 | mistralai/Voxtral-Mini-3B-2507 | Speech | Speech Recognition | 5.0B | — | 11.7 GB | —— | 180 RTFx | Whisper/Ministral 3B | Open ASR |
| 72 | HojoAI/Hojo-ASR-V1 | Speech | Speech Recognition | 5.2B | — | 12.1 GB | —— | 74 RTFx | Qwen3-Omni encoder/Qwen3-4B | Open ASR |
| 73 | microsoft/Phi-4-multimodal-instruct | Speech | Speech Recognition | 6.0B | — | 14.1 GB | —— | 163 RTFx | Conformer-based/Phi-4-Mini-Instruct | Open ASR |
| 74 | facebook/omniASR-CTC-7B-v2 | Speech | Speech Recognition | 6.5B | — | 15.2 GB | —— | 528 RTFx | Self-supervised/CTC | Open ASR |
| 75 | facebook/omniASR-LLM-7B-v2 | Speech | Speech Recognition | 7.8B | — | 18.3 GB | —— | 143 RTFx | Self-supervised/Transformer | Open ASR |
| 76 | microsoft/VibeVoice-ASR-HF | Speech | Speech Recognition | 8.0B | — | 18.8 GB | —— | 221 RTFx | Custom/Qwen2 | Open ASR |
| 77 | bosonai/higgs-audio-v3-8b-stt-v2 | Speech | Speech Recognition | 8.9B | — | 20.9 GB | —— | 139 RTFx | Whisper/Qwen3 | Open ASR |
| 78 | ibm-granite/granite-speech-3.3-8b | Speech | Speech Recognition | 9.0B | — | 21.1 GB | —— | 264 RTFx | Conformer-based/Granite | Open ASR |
| 79 | mistralai/Voxtral-Small-24B-2507 | Speech | Speech Recognition | 24.0B | — | 56.3 GB | —— | 100 RTFx | Whisper/Ministral 24B | Open ASR |
| 80 | aquavoice/avalon-v1-en | Speech | Speech Recognition | — | — | — | —— | — | — | Open ASR |
| 81 | assemblyai/universal-3-5-pro | Speech | Speech Recognition | — | — | — | —— | — | — | Open ASR |
| 82 | assemblyai/universal-3-pro | Speech | Speech Recognition | — | — | — | —— | — | — | Open ASR |
| 83 | elevenlabs/scribe_v2 | Speech | Speech Recognition | — | — | — | —— | — | — | Open ASR |
| 84 | gladia/solaria-3 | Speech | Speech Recognition | — | — | — | —— | — | — | Open ASR |
| 85 | microsoft/azure-speech-06-2026 | Speech | Speech Recognition | — | — | — | —— | — | — | Open ASR |
| 86 | modulate/vfast | Speech | Speech Recognition | — | — | — | —— | — | — | Open ASR |
| 87 | reson8/resonant-1 | Speech | Speech Recognition | — | — | — | —— | — | — | Open ASR |
| 88 | reson8/resonant-1-flash | Speech | Speech Recognition | — | — | — | —— | — | — | Open ASR |
| 89 | smallestai/pulse | Speech | Speech Recognition | — | — | — | —— | — | — | Open ASR |
| 90 | speechmatics/enhanced | Speech | Speech Recognition | — | — | — | —— | — | — | Open ASR |
| 91 | zoom/scribe_v1 | Speech | Speech Recognition | — | — | — | —— | — | — | Open ASR |