Supported ASR Engines Overview
OneASR provides an abstract engine architecture (BaseEngine) that standardizes model initialization, audio inference, and output formatting.
Engine Selection Guide
mermaid
flowchart TD
Start[Choose ASR Engine] --> Q1{Need Realtime Live Streaming?}
Q1 -- Yes (< 200ms) --> XASR[X-ASR / Zipformer2<br/>Ultra-low latency streaming]
Q1 -- No (Batch Audio Files) --> Q2{Language / Domain?}
Q2 -- 99+ Global Languages --> FW[Faster-Whisper<br/>Best general multilingual]
Q2 -- Complex Chinese / Dialects --> Qwen[Qwen3-ASR<br/>Large voice model]
Q2 -- Chinese Meeting / Enterprise --> FR[FireRedASR<br/>High-precision Mandarin]Detailed Specifications
- Faster-Whisper Engine — Highly optimized CTranslate2 Whisper implementation.
- X-ASR (Zipformer) — Sherpa-ONNX streaming transducer with chunk-based endpointing.
- Qwen3-ASR — Next-gen 1.7B parameter voice model with ForcedAligner support.
- FireRedASR — Enterprise Mandarin/English speech recognition engine.
