支持的 ASR 引擎特性概览
OneASR 采用模块化引擎设计(BaseEngine 抽象类),统一了不同语音识别模型的初始化、推理调用与输出标准化。
引擎选型建议
mermaid
flowchart TD
Start[ASR 引擎选型] --> Q1{是否需要超低延迟实时流式?}
Q1 -- 是 (< 200ms) --> XASR[X-ASR / Zipformer2<br/>毫秒级实时流式首选]
Q1 -- 否 (音视频长文件) --> Q2{语言与业务场景?}
Q2 -- 99+ 种多语种/播客/视频 --> FW[Faster-Whisper<br/>全球通用首选]
Q2 -- 复杂中文方言/嘈杂环境 --> Qwen[Qwen3-ASR<br/>大模型语音基座]
Q2 -- 政企会议纪要/呼叫中心 --> FR[FireRedASR<br/>高保真工业级中文]详细配置文档
- Faster-Whisper 引擎配置 — 基于 CTranslate2 的极速多语种转录引擎。
- X-ASR Zipformer 实时流式引擎 — 基于 Sherpa-ONNX 的低延迟流式转录。
- Qwen3-ASR 大模型语音识别 — 1.7B 参数的大模型语音基座。
- FireRedASR 工业级中文识别 — 专为普通话及电话客服优化的高精度引擎。
