Skip to content
セルフホスト · マルチエンジン統合 · OpenAI 完全互換

次世代の統合音声認識API ゲートウェイ & プライベート基盤

わずか数秒で独自のサーバーや Mac に産業用 ASR インフラを構築。Faster-Whisper、Zipformer (X-ASR)、Qwen-ASR、FireRedASR を集約し、OpenAI Audio API 規格に完全準拠。

# 1. Pull and run OneASR with GPU acceleration
$ docker run -d -p 8000:8000 --gpus all codeandxv/oneasr:latest
INFO: Preloading ASR Engines [whisper-medium, xasr-zh-en]...
INFO: Application startup complete. Uvicorn running on http://0.0.0.0:8000
OpenAI API ready at /v1/audio/transcriptions

高スループット・低遅延・プライバシー重視の設計

個人の作業効率化から企業のセキュアなプライベート音声パイプラインまで対応。

🔄完全互換

OpenAI 規格完全互換

/v1/audio/transcriptions をシームレスに代替。Dify、FastGPT、Open WebUI、DuRT、公式 SDK に即時接続可能。

⚡柔軟な統合

複数エンジンの統合 & 動的切替

シンプルな YAML 設定で Faster-Whisper、Zipformer (X-ASR)、Qwen-ASR、FireRedASR を柔軟にルーティング。

🌊< 200ms 高速

超低遅延 WebSocket ストリーミング

リアルタイム字幕、同時通訳、音声対話エージェント(Voice Agent)に最適なミリ秒単位の双方向音声ストリーム。

🎯スマート VAD

高精度 VAD とスマートチャンク分割

Silero-VAD 音声アクティビティ検出を統合。自然なポーズでの文分割、長尺音声の最適分割、幻覚(繰り返し)の自動除去。

🖥️UI 標準搭載

Vue 3 Web コンソール標準搭載

マイク録音テスト、長尺ファイル文字起こし、GPU ステータス監視、タスクキュー管理が可能な洗練された UI。

🔒完全な機密性

100% プライベート & セルフホスト

すべての音声データはローカル/社内ネットワーク内に完結。第三者への転送やデータ流出の心配は一切ありません。

対応 ASR エンジン一覧

言語、遅延要件、ハードウェア性能に応じて最適な認識エンジンを選択できます。

エンジンタイプ対応言語遅延 / RTFハードウェア加速最適用途
Faster-Whisperファイル処理推奨ファイル・バッチ文字起こし99以上の言語(多言語対応)0.12x - 0.25x RTFCUDA, Metal, CPU (int8/fp16)長尺ファイル文字起こし、ポッドキャスト字幕生成、多言語翻訳
X-ASR (Zipformer2)超低遅延首位リアルタイム音声認識日本語・英語・中国語・混在< 160ms チャンク遅延CPU, ONNX, Metal, CUDA超低遅延リアルタイム字幕、会議同報、音声対話アシスタント
Qwen3-ASR (1.7B)大規模音声認識モデル30以上の言語・主要方言0.15x - 0.35x RTFCUDA (vLLM / PyTorch), Metal複雑な方言、ノイズ環境下での高精度認識、専門用語
FireRedASRエンタープライズ ASR中国語、英語0.18x - 0.30x RTFCUDA, PyTorchビジネス会議議事録、コンタクトセンター通話分析

OneASR パイプライン アーキテクチャ

音声入力、前処理、動的ルーティングから構造化出力までの標準フロー。

Step 01

1. 受信 & 音声前処理

REST または WebSocket で音声を受信し、16kHz モノラルへ正規化。Silero-VAD により発話区間を検出。

Step 02

2. 動的ディスパッチャ

リクエストの言語やレイテンシ要件に基づき、事前にメモリ展開された最適な ASR エンジンにルーティング。

Step 03

3. ニューラル推論 & アライメント

音響モデルとデコーダが CUDA TensorRT や Metal の GPU 加速を活用し、ミリ秒単位のタイムスタンプを生成。

Step 04

4. 後処理 & 標準フォーマット出力

句読点補正と重複除去を行い、OpenAI 互換 JSON、SRT、VTT 形式でレスポンス。

優れた開発者体験

使い慣れたツールと標準プロトコルで、わずか数行のコードで OneASR を統合。

from openai import OpenAI

# Initialize client pointing to your local OneASR gateway
client = OpenAI(
    base_url="http://localhost:8000/v1",
    api_key="sk-oneasr-v1-p_L3kXm9QZ8sT2vA4wE7rY1u"
)

# Transcribe audio file with word-level timestamps
with open("podcast.mp3", "rb") as audio_file:
    transcript = client.audio.transcriptions.create(
        model="faster-whisper",
        file=audio_file,
        response_format="verbose_json",
        timestamp_granularities=["word", "segment"]
    )

print(transcript.text)