Skip to content

X-ASR (Zipformer) Streaming Engine ​

X-ASR is OneASR’s primary real-time streaming engine, utilizing Sherpa-ONNX and next-generation Zipformer2 Transducer acoustic models.


Key Highlights ​

  • Ultra-Low Latency: 160ms audio chunk processing with minimal CPU overhead.
  • Continuous Endpoint Detection: Built-in silence tracking to naturally delimit sentences.
  • Bi-directional WebSocket: Streams incoming PCM audio while simultaneously emitting partial and final text tokens.

Configuration Example ​

yaml
ASR-Providers:
  xasr:
    enable: true
    engine: xasr
    load:
      model_name: xasr-zh-en
      tokens_path: models/chunk-160ms-model/tokens.txt
      encoder_path: models/chunk-160ms-model/encoder-160ms.onnx
      decoder_path: models/chunk-160ms-model/decoder-160ms.onnx
      joiner_path: models/chunk-160ms-model/joiner-160ms.onnx
      provider: cpu # or cuda
      sample_rate: 16000
      decoding_method: greedy_search