秒級在私有伺服器或 Mac 上部署工業級 ASR 基礎設施。聚合 Faster-Whisper、X-ASR (Zipformer)、Qwen3-ASR 與 FireRedASR,完美相容 OpenAI Audio API 標準。
滿足團隊從個人生產力到企業私有化語音管道的一切需求。
無縫平替 /v1/audio/transcriptions。零修改直連 Dify、FastGPT、Open WebUI、DuRT 及官方 OpenAI SDK。
透過清晰的 YAML 配置自由切換 Faster-Whisper、Zipformer (X-ASR)、Qwen-ASR 與 FireRedASR 等前沿模型。
支援毫秒級分塊即時雙工流式傳輸,專為即時字幕、會議同傳與語音對話智能體(Voice Agent)打造。
深度整合 Silero-VAD 語音活動檢測,具備自然停頓斷句、長音訊切片與 ASR 連續複讀幻覺自動過濾機制。
開箱即用的 Web 儀表板,支援即時麥克風錄音測試、大檔案音視頻轉錄、GPU 狀態監視與任務佇列追蹤。
所有音訊流與文字數據全程停留在本地或內網環境。零雲端中轉、零遙測收集、零供應商鎖定。
根據具體的語言類型、延遲要求與硬體算力,靈活匹配最佳推理引擎。
| 引擎名稱 | 引擎定位 | 支援語種 | 推理延遲 / RTF | 硬體加速支援 | 最佳適用場景 |
|---|---|---|---|---|---|
| Faster-Whisper檔案轉錄推薦 | 長音訊與批次轉錄 | 99+ 種全球語言(多語言) | 0.12x - 0.25x RTF | CUDA, Metal, CPU (int8/fp16) | 多語種長檔案轉錄、Podcast 字幕生成、跨語種聽寫 |
| X-ASR (Zipformer2)超低延遲首選 | 即時流式語音辨識 | 中文、英文、中英混合 | < 160ms 塊級延遲 | CPU, ONNX, Metal, CUDA | 超低延遲即時字幕、會議同傳、語音互動助理 |
| Qwen3-ASR (1.7B) | 大模型語音辨識 | 30+ 種語言、常見方言 | 0.15x - 0.35x RTF | CUDA (vLLM / PyTorch), Metal | 複雜中文方言、吵雜環境降噪辨識、特定行業術語 |
| FireRedASR | 工業級通用 ASR | 中文、英文 | 0.18x - 0.30x RTF | CUDA, PyTorch | 企業級政企會議紀要、高保真普通話客服中心 |
從音訊接收、預處理、動態分發到結構化結果輸出的標準架構。
透過 REST 或 WebSocket 接入音訊,自動重採樣為 16kHz 單聲道,並由 Silero-VAD 進行智能語音分段。
根據請求攜帶的語言標籤與延遲模式,秒級分發至預熱就緒的 ASR 引擎(Whisper/Zipformer/Qwen)。
聲學與語言模型協同解碼,利用 CUDA TensorRT 或 Metal 算力加速生成詞級毫秒時間戳。
標點規範化、去重去噪,最終組裝為 OpenAI JSON、SRT 或 VTT 格式返回。
使用你熟悉的工具和標準協定,數行程式碼無縫整合 OneASR。
from openai import OpenAI
# Initialize client pointing to your local OneASR gateway
client = OpenAI(
base_url="http://localhost:8000/v1",
api_key="sk-oneasr-v1-p_L3kXm9QZ8sT2vA4wE7rY1u"
)
# Transcribe audio file with word-level timestamps
with open("podcast.mp3", "rb") as audio_file:
transcript = client.audio.transcriptions.create(
model="faster-whisper",
file=audio_file,
response_format="verbose_json",
timestamp_granularities=["word", "segment"]
)
print(transcript.text)