Skip to content

OneASR 项目概览与核心架构 ​

OneASR 是一款开源、高吞吐、低延迟的语音识别(ASR)聚合网关与自托管推理服务框架。它将业界主流前沿的语音模型标准化封装为统一的 OpenAI Audio API 规范以及毫秒级全双工 WebSocket 流式接口。


为什么需要 OneASR? ​

在现代 AI 应用与语音对话系统(Voice Agent)开发中,自建私有化语音识别往往面临接口碎片化、缺乏标准 VAD 切片组件、模型调度复杂以及商业云端 API 成本高昂等痛点。

OneASR 专为解决上述问题而设计:

  1. OpenAI 规范全兼容:零修改平替 POST /v1/audio/transcriptions 接口。
  2. 多引擎动态聚合:一行配置即插即用 Faster-Whisper、X-ASR (Zipformer)、Qwen3-ASR 及 FireRedASR。
  3. 原生 VAD 与智能分句:深度整合 Silero-VAD 语音活动检测,支持停顿断句、大文件切片与幻觉抑制。
  4. 100% 数据掌控与私有化:在本地 Mac、私有 GPU 服务器或 Kubernetes 集群中部署,数据绝对零外泄。

系统架构拓扑图 ​

[ 客户端 & 第三方 AI 系统 ] (DuRT, Dify, Open WebUI, Python SDK, cURL)
        │
        ▼ (HTTP REST / WebSocket)
┌────────────────────────────────────────────────────────┐
│                   OneASR Gateway (FastAPI)             │
│                                                        │
│  ┌───────────────────────┐  ┌───────────────────────┐  │
│  │   鉴权与 API 路由层    │  │  ASR-Toolkit (VAD)    │  │
│  │  • /v1/audio/*        │  │  • Silero-VAD 语音检测 │  │
│  │  • /api/v1/stream     │  │  • 动态时间片切割     │  │
│  └───────────┬───────────┘  └───────────┬───────────┘  │
│              │                          │              │
│              ▼                          ▼              │
│  ┌──────────────────────────────────────────────────┐  │
│  │              引擎注册中心与请求分发调度           │  │
│  └──────────────────────────┬───────────────────────┘  │
└─────────────────────────────┼──────────────────────────┘
                              │
         ┌────────────────────┼────────────────────┐
         ▼                    ▼                    ▼
┌──────────────────┐ ┌──────────────────┐ ┌──────────────────┐
│  Faster-Whisper  │ │  X-ASR Zipformer │ │    Qwen3-ASR     │
│ (多语种批处理)    │ │ (超低延迟实时流) │ │ (大模型大词汇量) │
└──────────────────┘ └──────────────────┘ └──────────────────┘

核心特性 ​

  • 超低延迟实时流:基于 Zipformer2 Transducer 架构,支持 < 160ms 块级实时流式识别。
  • 异步批处理任务队列:支持上传数 GB 级别超长音视频文件,后台多 Worker 异步转录与进度轮询。
  • 词级毫秒时间戳:精准对齐字幕(SRT/VTT),为视频创作者与会议纪要提供高保真时间轴。
  • 内置 Vue 3 可视化面板:开箱即用的 Web 仪表盘,支持麦克风在线试音、模型性能基准与队列管理。

快速导航 ​