Skip to content

Supported ASR Engines Overview ​

OneASR provides an abstract engine architecture (BaseEngine) that standardizes model initialization, audio inference, and output formatting.


Engine Selection Guide ​

mermaid
flowchart TD
    Start[Choose ASR Engine] --> Q1{Need Realtime Live Streaming?}
    Q1 -- Yes (< 200ms) --> XASR[X-ASR / Zipformer2<br/>Ultra-low latency streaming]
    Q1 -- No (Batch Audio Files) --> Q2{Language / Domain?}
    
    Q2 -- 99+ Global Languages --> FW[Faster-Whisper<br/>Best general multilingual]
    Q2 -- Complex Chinese / Dialects --> Qwen[Qwen3-ASR<br/>Large voice model]
    Q2 -- Chinese Meeting / Enterprise --> FR[FireRedASR<br/>High-precision Mandarin]

Detailed Specifications ​

  • Faster-Whisper Engine — Highly optimized CTranslate2 Whisper implementation.
  • X-ASR (Zipformer) — Sherpa-ONNX streaming transducer with chunk-based endpointing.
  • Qwen3-ASR — Next-gen 1.7B parameter voice model with ForcedAligner support.
  • FireRedASR — Enterprise Mandarin/English speech recognition engine.