OneASR 專案概覽與核心架構
OneASR 是一款開源、高吞吐量、低延遲的語音辨識(ASR)聚合閘道與自託管推論服務框架。它將業界主流前沿的語音模型標準化封裝為統一的 OpenAI Audio API 規範以及毫秒級全雙工 WebSocket 即時串流介面。
為什麼需要 OneASR?
在現代 AI 應用與語音對話系統(Voice Agent)開發中,自建私有化語音辨識往往面臨介面碎片化、缺乏標準 VAD 切片元件、模型調度複雜以及商業雲端 API 成本高昂等痛點。
OneASR 專為解決上述問題而設計:
- OpenAI 規範全相容:零修改平替
POST /v1/audio/transcriptions介面。 - 多引擎動態聚合:一行設定即插即用 Faster-Whisper、X-ASR (Zipformer)、Qwen3-ASR 及 FireRedASR。
- 原生 VAD 與智慧分句:深度整合 Silero-VAD 語音活動檢測,支援停頓斷句、大檔案切片與幻覺抑制。
- 100% 資料掌控與私有化:在本地 Mac、私有 GPU 伺服器或 Kubernetes 叢集中部署,資料絕對零外洩。
系統架構拓撲圖
[ 用戶端 & 第三方 AI 系統 ] (DuRT, Dify, Open WebUI, Python SDK, cURL)
│
▼ (HTTP REST / WebSocket)
┌────────────────────────────────────────────────────────┐
│ OneASR Gateway (FastAPI) │
│ │
│ ┌───────────────────────┐ ┌───────────────────────┐ │
│ │ 鑑權與 API 路由層 │ │ ASR-Toolkit (VAD) │ │
│ │ • /v1/audio/* │ │ • Silero-VAD 語音檢測 │ │
│ │ • /api/v1/stream │ │ • 動態時間片切割 │ │
│ └───────────┬───────────┘ └───────────┬───────────┘ │
│ │ │ │
│ ▼ ▼ │
│ ┌──────────────────────────────────────────────────┐ │
│ │ 引擎註冊中心與請求分發調度 │ │
│ └──────────────────────────┬───────────────────────┘ │
└─────────────────────────────┼──────────────────────────┘
│
┌────────────────────┼────────────────────┐
▼ ▼ ▼
┌──────────────────┐ ┌──────────────────┐ ┌──────────────────┐
│ Faster-Whisper │ │ X-ASR Zipformer │ │ Qwen3-ASR │
│ (多語種批次處理) │ │ (超低延遲即時串流)│ │ (大模型大詞彙量) │
└──────────────────┘ └──────────────────┘ └──────────────────┘核心特性
- 超低延遲即時串流:基於 Zipformer2 Transducer 架構,支援 < 160ms 塊級即時串流辨識。
- 非同步批次處理任務佇列:支援上傳數 GB 級別超長音訊/視訊檔案,後台多 Worker 非同步轉錄與進度輪詢。
- 詞級毫秒時間戳記:精準對齊字幕(SRT/VTT),為影片創作者與會議記錄提供高保真時間軸。
- 內建 Vue 3 視覺化面板:開箱即用的 Web 儀表板,支援麥克風線上試音、模型效能基準與佇列管理。
快速導覽
- Docker 容器化部署 — 使用 NVIDIA GPU 極速啟動 OneASR 服務。
- 原始碼與 Python 本地安裝 — 了解如何在 Mac 或 Linux 環境設定 Python 執行環境。
- 硬體算力與 GPU 加速 — 調優 CUDA、Apple Silicon Metal 與 CPU 多執行緒。
