OneASR 项目概览与核心架构
OneASR 是一款开源、高吞吐、低延迟的语音识别(ASR)聚合网关与自托管推理服务框架。它将业界主流前沿的语音模型标准化封装为统一的 OpenAI Audio API 规范以及毫秒级全双工 WebSocket 流式接口。
为什么需要 OneASR?
在现代 AI 应用与语音对话系统(Voice Agent)开发中,自建私有化语音识别往往面临接口碎片化、缺乏标准 VAD 切片组件、模型调度复杂以及商业云端 API 成本高昂等痛点。
OneASR 专为解决上述问题而设计:
- OpenAI 规范全兼容:零修改平替
POST /v1/audio/transcriptions接口。 - 多引擎动态聚合:一行配置即插即用 Faster-Whisper、X-ASR (Zipformer)、Qwen3-ASR 及 FireRedASR。
- 原生 VAD 与智能分句:深度整合 Silero-VAD 语音活动检测,支持停顿断句、大文件切片与幻觉抑制。
- 100% 数据掌控与私有化:在本地 Mac、私有 GPU 服务器或 Kubernetes 集群中部署,数据绝对零外泄。
系统架构拓扑图
[ 客户端 & 第三方 AI 系统 ] (DuRT, Dify, Open WebUI, Python SDK, cURL)
│
▼ (HTTP REST / WebSocket)
┌────────────────────────────────────────────────────────┐
│ OneASR Gateway (FastAPI) │
│ │
│ ┌───────────────────────┐ ┌───────────────────────┐ │
│ │ 鉴权与 API 路由层 │ │ ASR-Toolkit (VAD) │ │
│ │ • /v1/audio/* │ │ • Silero-VAD 语音检测 │ │
│ │ • /api/v1/stream │ │ • 动态时间片切割 │ │
│ └───────────┬───────────┘ └───────────┬───────────┘ │
│ │ │ │
│ ▼ ▼ │
│ ┌──────────────────────────────────────────────────┐ │
│ │ 引擎注册中心与请求分发调度 │ │
│ └──────────────────────────┬───────────────────────┘ │
└─────────────────────────────┼──────────────────────────┘
│
┌────────────────────┼────────────────────┐
▼ ▼ ▼
┌──────────────────┐ ┌──────────────────┐ ┌──────────────────┐
│ Faster-Whisper │ │ X-ASR Zipformer │ │ Qwen3-ASR │
│ (多语种批处理) │ │ (超低延迟实时流) │ │ (大模型大词汇量) │
└──────────────────┘ └──────────────────┘ └──────────────────┘核心特性
- 超低延迟实时流:基于 Zipformer2 Transducer 架构,支持 < 160ms 块级实时流式识别。
- 异步批处理任务队列:支持上传数 GB 级别超长音视频文件,后台多 Worker 异步转录与进度轮询。
- 词级毫秒时间戳:精准对齐字幕(SRT/VTT),为视频创作者与会议纪要提供高保真时间轴。
- 内置 Vue 3 可视化面板:开箱即用的 Web 仪表盘,支持麦克风在线试音、模型性能基准与队列管理。
快速导航
- Docker 容器化部署 — 使用 NVIDIA GPU 极速启动 OneASR 服务。
- 源码与 Python 本地安装 — 了解如何在 Mac 或 Linux 环境配置 Python 运行环境。
- 硬件算力与 GPU 加速 — 调优 CUDA、Apple Silicon Metal 与 CPU 多线程。
