支援的 ASR 引擎特性概覽
OneASR 採用模組化引擎設計(BaseEngine 抽象類別),統一了不同語音辨識模型的初始化、推論呼叫與輸出標準化。
引擎選型建議
mermaid
flowchart TD
Start[ASR 引擎選型] --> Q1{是否需要超低延遲即時串流?}
Q1 -- 是 (< 200ms) --> XASR[X-ASR / Zipformer2<br/>毫秒級即時串流首選]
Q1 -- 否 (音訊/視訊長檔案) --> Q2{語言與業務場景?}
Q2 -- 99+ 種多語種/Podcast/影片 --> FW[Faster-Whisper<br/>全球通用首選]
Q2 -- 複雜中文方言/嘈雜環境 --> Qwen[Qwen3-ASR<br/>大模型語音基座]
Q2 -- 政企會議記錄/客服中心 --> FR[FireRedASR<br/>高保真工業級中文]詳細設定文件
- Faster-Whisper 引擎設定 — 基於 CTranslate2 的極速多語種轉錄引擎。
- X-ASR Zipformer 即時串流引擎 — 基於 Sherpa-ONNX 的低延遲串流轉錄。
- Qwen3-ASR 大模型語音辨識 — 1.7B 參數的大模型語音基座。
- FireRedASR 工業級中文辨識 — 專為國語及電話客服最佳化的高精度引擎。
