Domain
Task
Showing 67 models
| # | Model | Domain | Task | Params ↑ | GFLOPs | VRAM | Score | Speed | Arch | Source |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | abr-ai/niagara-9m-batch.en | Speech | Speech Recognition | 9.00M | — | 22 MB | —— | 7158 RTFx | State-space model/CTC | Open ASR |
| 2 | abr-ai/niagara-19m-batch.en | Speech | Speech Recognition | 20.0M | — | 48 MB | —— | 4324 RTFx | State-space model/CTC | Open ASR |
| 3 | abr-ai/niagara-38m-batch.en | Speech | Speech Recognition | 38.0M | — | 91 MB | —— | 4015 RTFx | — | Open ASR |
| 4 | nvidia/canary-180m-flash | Speech | Speech Recognition | 180.0M | — | 432 MB | —— | 2489 RTFx | Conformer-based/Transformer | Open ASR |
| 5 | soundsgoodai/Zipformer-cr-ctc-transducer-XL-290M | Speech | Speech Recognition | 290.0M | — | 696 MB | —— | 158 RTFx | Zipformer/Pruned Stateless Transducer with k2 modified_beam_search | Open ASR |
| 6 | soundsgoodai/Zipformer-transducer-XL-290M | Speech | Speech Recognition | 290.0M | — | 696 MB | —— | 141 RTFx | Zipformer/RNN-T | Open ASR |
| 7 | AutoArk-AI/Audio8-ASR-0.1B | Speech | Speech Recognition | 324.0M | — | 778 MB | —— | 719 RTFx | Qwen3-ASR audio encoder/8-layer Qwen-style causal LM | Open ASR |
| 8 | ibm-granite/granite-speech-5.0-470m-turboctc | Speech | Speech Recognition | 470.0M | — | 1.1 GB | —— | 12946 RTFx | Streaming-style Conformer/CTC | Open ASR |
| 9 | ibm-granite/granite-speech-5.0-470m-turboctc-nc | Speech | Speech Recognition | 470.0M | — | 1.1 GB | —— | 12762 RTFx | Streaming-style Conformer/CTC | Open ASR |
| 10 | nvidia/parakeet-ctc-0.6b | Speech | Speech Recognition | 600.0M | — | 1.4 GB | —— | 5870 RTFx | Conformer-based/CTC | Open ASR |
| 11 | nvidia/parakeet-rnnt-0.6b | Speech | Speech Recognition | 600.0M | — | 1.4 GB | —— | 5431 RTFx | Conformer-based/TDT / RNN-T | Open ASR |
| 12 | nvidia/parakeet-tdt-0.6b-v2 | Speech | Speech Recognition | 600.0M | — | 1.4 GB | —— | 6025 RTFx | Conformer-based/TDT / RNN-T | Open ASR |
| 13 | nvidia/parakeet-tdt-0.6b-v3 | Speech | Speech Recognition | 600.0M | — | 1.4 GB | —— | 6076 RTFx | Conformer-based/TDT / RNN-T | Open ASR |
| 14 | nvidia/nemotron-speech-streaming-en-0.6b | Speech | Speech Recognition | 620.0M | — | 1.5 GB | —— | 1167 RTFx | FastConformer (cache-aware)/RNNT | Open ASR |
| 15 | nvidia/nemotron-3.5-asr-streaming-0.6b | Speech | Speech Recognition | 640.0M | — | 1.5 GB | —— | 1345 RTFx | FastConformer (cache-aware)/RNNT | Open ASR |
| 16 | Qwen/Qwen3-ASR-0.6B-hf | Speech | Speech Recognition | 780.0M | — | 1.8 GB | —— | 744 RTFx | Custom/Qwen3 | Open ASR |
| 17 | distil-whisper/distil-large-v3.5 | Speech | Speech Recognition | 800.0M | — | 1.9 GB | —— | 879 RTFx | Whisper/Transformer | Open ASR |
| 18 | openai/whisper-large-v3-turbo | Speech | Speech Recognition | 800.0M | — | 1.9 GB | —— | 797 RTFx | Whisper/Transformer | Open ASR |
| 19 | FunAudioLLM/Fun-ASR-Nano-2512-hf | Speech | Speech Recognition | 830.0M | — | 1.9 GB | —— | 497 RTFx | Qwen3-ASR/Custom | Open ASR |
| 20 | OpenMOSS-Team/MOSS-Transcribe-Diarize | Speech | Speech Recognition | 910.0M | — | 2.1 GB | —— | 381 RTFx | "Whisper audio encoder/24 layers" | Open ASR |
| 21 | espnet/owsm_ctc_v4_1B | Speech | Speech Recognition | 1.0B | — | 2.3 GB | —— | 777 RTFx | Whisper/CTC | Open ASR |
| 22 | nvidia/canary-1b | Speech | Speech Recognition | 1.0B | — | 2.3 GB | —— | 767 RTFx | Conformer-based/Transformer | Open ASR |
| 23 | nvidia/canary-1b-flash | Speech | Speech Recognition | 1.0B | — | 2.3 GB | —— | 2129 RTFx | Conformer-based/Transformer | Open ASR |
| 24 | nvidia/canary-1b-v2 | Speech | Speech Recognition | 1.0B | — | 2.3 GB | —— | 1825 RTFx | Conformer-based/Transformer | Open ASR |
| 25 | nvidia/parakeet-ctc-1.1b | Speech | Speech Recognition | 1.1B | — | 2.6 GB | —— | 5023 RTFx | Conformer-based/CTC | Open ASR |
| 26 | nvidia/parakeet-rnnt-1.1b | Speech | Speech Recognition | 1.1B | — | 2.6 GB | —— | 4139 RTFx | Conformer-based/TDT / RNN-T | Open ASR |
| 27 | AutoArk-AI/ARK-ASR-0.6B | Speech | Speech Recognition | 1.1B | — | 2.7 GB | —— | 663 RTFx | Whisper/Qwen2 | Open ASR |
| 28 | CohereLabs/cohere-transcribe-03-2026 | Speech | Speech Recognition | 2.0B | — | 4.7 GB | —— | 907 RTFx | Conformer-based/Transformer | Open ASR |
| 29 | ibm-granite/granite-4.0-1b-speech | Speech | Speech Recognition | 2.0B | — | 4.7 GB | —— | 666 RTFx | Conformer-based/Granite | Open ASR |
| 30 | ibm-granite/granite-speech-4.1-2b | Speech | Speech Recognition | 2.0B | — | 4.7 GB | —— | 546 RTFx | Conformer-based/Granite | Open ASR |
| 31 | ibm-granite/granite-speech-4.1-2b-nar | Speech | Speech Recognition | 2.0B | — | 4.7 GB | —— | 2074 RTFx | Conformer-based/Hybrid CTC-LLM | Open ASR |
| 32 | openai/whisper-large-v3 | Speech | Speech Recognition | 2.0B | — | 4.7 GB | —— | 470 RTFx | Whisper/Transformer | Open ASR |
| 33 | zai-org/GLM-ASR-Nano-2512 | Speech | Speech Recognition | 2.0B | — | 4.7 GB | —— | 334 RTFx | Whisper/Llama | Open ASR |
| 34 | Qwen/Qwen3-ASR-1.7B-hf | Speech | Speech Recognition | 2.0B | — | 4.8 GB | —— | 820 RTFx | Custom/Qwen3 | Open ASR |
| 35 | OpenMOSS-Team/MOSS-Transcribe-preview-2B | Speech | Speech Recognition | 2.4B | — | 5.7 GB | —— | 151 RTFx | Qwen3-Omni-MoE audio encoder/Qwen3 | Open ASR |
| 36 | nvidia/canary-qwen-2.5b | Speech | Speech Recognition | 2.5B | — | 5.9 GB | —— | 867 RTFx | Conformer-based/Qwen2 | Open ASR |
| 37 | kyutai/stt-2.6b-en | Speech | Speech Recognition | 2.6B | — | 6.1 GB | —— | 133 RTFx | Mimi tokenizer/Transformer | Open ASR |
| 38 | bosonai/higgs-audio-v3-stt | Speech | Speech Recognition | 2.7B | — | 6.3 GB | —— | 111 RTFx | Whisper/Qwen3 | Open ASR |
| 39 | ibm-granite/granite-speech-3.3-2b | Speech | Speech Recognition | 3.0B | — | 7.0 GB | —— | 509 RTFx | Conformer-based/Granite | Open ASR |
| 40 | AutoArk-AI/ARK-ASR-3B | Speech | Speech Recognition | 3.8B | — | 8.8 GB | —— | 481 RTFx | Whisper/Qwen2 | Open ASR |
| 41 | mistralai/Voxtral-Mini-4B-Realtime-2602 | Speech | Speech Recognition | 4.0B | — | 9.4 GB | —— | 103 RTFx | Custom/Transformer | Open ASR |
| 42 | mistralai/Voxtral-Mini-3B-2507 | Speech | Speech Recognition | 5.0B | — | 11.7 GB | —— | 181 RTFx | Whisper/Ministral 3B | Open ASR |
| 43 | HojoAI/Hojo-ASR-V1 | Speech | Speech Recognition | 5.2B | — | 12.1 GB | —— | 73 RTFx | Qwen3-Omni encoder/Qwen3-4B | Open ASR |
| 44 | microsoft/Phi-4-multimodal-instruct | Speech | Speech Recognition | 6.0B | — | 14.1 GB | —— | 163 RTFx | Conformer-based/Phi-4-Mini-Instruct | Open ASR |
| 45 | facebook/omniASR-CTC-7B-v2 | Speech | Speech Recognition | 6.5B | — | 15.2 GB | —— | 519 RTFx | Self-supervised/CTC | Open ASR |
| 46 | facebook/omniASR-LLM-7B-v2 | Speech | Speech Recognition | 7.8B | — | 18.3 GB | —— | 129 RTFx | Self-supervised/Transformer | Open ASR |
| 47 | google/gemma-4-E4B-it | Speech | Speech Recognition | 7.9B | — | 18.6 GB | —— | 161 RTFx | Conformer/Transformer | Open ASR |
| 48 | microsoft/VibeVoice-ASR-HF | Speech | Speech Recognition | 8.0B | — | 18.8 GB | —— | 219 RTFx | Custom/Qwen2 | Open ASR |
| 49 | bosonai/higgs-audio-v3-8b-stt-v2 | Speech | Speech Recognition | 8.9B | — | 20.9 GB | —— | 137 RTFx | Whisper/Qwen3 | Open ASR |
| 50 | ibm-granite/granite-speech-3.3-8b | Speech | Speech Recognition | 9.0B | — | 21.1 GB | —— | 263 RTFx | Conformer-based/Granite | Open ASR |
| 51 | mistralai/Voxtral-Small-24B-2507 | Speech | Speech Recognition | 24.0B | — | 56.3 GB | —— | 101 RTFx | Whisper/Ministral 24B | Open ASR |
| 52 | assemblyai/universal-3-5-pro | Speech | Speech Recognition | — | — | — | —— | — | — | Open ASR |
| 53 | elevenlabs/scribe_v2 | Speech | Speech Recognition | — | — | — | —— | — | — | Open ASR |
| 54 | gladia/solaria-3 | Speech | Speech Recognition | — | — | — | —— | — | — | Open ASR |
| 55 | google/gemma-4-12B-it | Speech | Speech Recognition | — | — | — | —— | 106 RTFx | — | Open ASR |
| 56 | google/gemma-4-E2B-it | Speech | Speech Recognition | — | — | — | —— | 191 RTFx | Conformer/Transformer | Open ASR |
| 57 | meta/muse-voice-transcribe | Speech | Speech Recognition | — | — | — | —— | — | — | Open ASR |
| 58 | microsoft/azure-speech-06-2026 | Speech | Speech Recognition | — | — | — | —— | — | — | Open ASR |
| 59 | microsoft/azure-speech-07-2026 | Speech | Speech Recognition | — | — | — | —— | — | — | Open ASR |
| 60 | modulate/multilingual | Speech | Speech Recognition | — | — | — | —— | — | — | Open ASR |
| 61 | reson8/resonant-1 | Speech | Speech Recognition | — | — | — | —— | — | — | Open ASR |
| 62 | reson8/resonant-1-flash | Speech | Speech Recognition | — | — | — | —— | — | — | Open ASR |
| 63 | smallestai/pulse | Speech | Speech Recognition | — | — | — | —— | — | — | Open ASR |
| 64 | sophea/asr-k1 (preview) | Speech | Speech Recognition | — | — | — | —— | — | — | Open ASR |
| 65 | speechmatics/enhanced | Speech | Speech Recognition | — | — | — | —— | — | — | Open ASR |
| 66 | zoom/scribe_v1 | Speech | Speech Recognition | — | — | — | —— | — | — | Open ASR |
| 67 | zoom/scribe_v2_pro | Speech | Speech Recognition | — | — | — | —— | — | — | Open ASR |