Skip to content

OneASR 專案概覽與核心架構 ​

OneASR 是一款開源、高吞吐量、低延遲的語音辨識(ASR)聚合閘道與自託管推論服務框架。它將業界主流前沿的語音模型標準化封裝為統一的 OpenAI Audio API 規範以及毫秒級全雙工 WebSocket 即時串流介面。


為什麼需要 OneASR? ​

在現代 AI 應用與語音對話系統(Voice Agent)開發中,自建私有化語音辨識往往面臨介面碎片化、缺乏標準 VAD 切片元件、模型調度複雜以及商業雲端 API 成本高昂等痛點。

OneASR 專為解決上述問題而設計:

  1. OpenAI 規範全相容:零修改平替 POST /v1/audio/transcriptions 介面。
  2. 多引擎動態聚合:一行設定即插即用 Faster-Whisper、X-ASR (Zipformer)、Qwen3-ASR 及 FireRedASR。
  3. 原生 VAD 與智慧分句:深度整合 Silero-VAD 語音活動檢測,支援停頓斷句、大檔案切片與幻覺抑制。
  4. 100% 資料掌控與私有化:在本地 Mac、私有 GPU 伺服器或 Kubernetes 叢集中部署,資料絕對零外洩。

系統架構拓撲圖 ​

[ 用戶端 & 第三方 AI 系統 ] (DuRT, Dify, Open WebUI, Python SDK, cURL)
        │
        ▼ (HTTP REST / WebSocket)
┌────────────────────────────────────────────────────────┐
│                   OneASR Gateway (FastAPI)             │
│                                                        │
│  ┌───────────────────────┐  ┌───────────────────────┐  │
│  │   鑑權與 API 路由層   │  │  ASR-Toolkit (VAD)    │  │
│  │  • /v1/audio/*        │  │  • Silero-VAD 語音檢測 │  │
│  │  • /api/v1/stream     │  │  • 動態時間片切割     │  │
│  └───────────┬───────────┘  └───────────┬───────────┘  │
│              │                          │              │
│              ▼                          ▼              │
│  ┌──────────────────────────────────────────────────┐  │
│  │              引擎註冊中心與請求分發調度          │  │
│  └──────────────────────────┬───────────────────────┘  │
└─────────────────────────────┼──────────────────────────┘
                              │
         ┌────────────────────┼────────────────────┐
         ▼                    ▼                    ▼
┌──────────────────┐ ┌──────────────────┐ ┌──────────────────┐
│  Faster-Whisper  │ │  X-ASR Zipformer │ │    Qwen3-ASR     │
│ (多語種批次處理)  │ │ (超低延遲即時串流)│ │ (大模型大詞彙量) │
└──────────────────┘ └──────────────────┘ └──────────────────┘

核心特性 ​

  • 超低延遲即時串流:基於 Zipformer2 Transducer 架構,支援 < 160ms 塊級即時串流辨識。
  • 非同步批次處理任務佇列:支援上傳數 GB 級別超長音訊/視訊檔案,後台多 Worker 非同步轉錄與進度輪詢。
  • 詞級毫秒時間戳記:精準對齊字幕(SRT/VTT),為影片創作者與會議記錄提供高保真時間軸。
  • 內建 Vue 3 視覺化面板:開箱即用的 Web 儀表板,支援麥克風線上試音、模型效能基準與佇列管理。

快速導覽 ​