OneASR プロジェクト概要とコアアーキテクチャ
OneASR は、オープンソースで高スループット・低遅延の音声認識(ASR)統合ゲートウェイおよびセルフホスト推論サービスフレームワークです。業界最先端の音声モデルを標準化し、統一された OpenAI Audio API 仕様およびミリ秒単位の全二重 WebSocket ストリーミングインターフェースとして提供します。
なぜ OneASR なのか?
最新の AI アプリケーションや音声対話エージェント(Voice Agent)の開発において、自前のプライベート音声認識基盤を構築する際には、インターフェースの断片化、標準的な VAD(音声活動検出)スライスコンポーネントの不足、複雑なモデルスケジューリング、そして商用クラウド API の高額なコストなどの課題に直面します。
OneASR は、これらの課題を解決するために設計されました:
- OpenAI 仕様に完全準拠:
POST /v1/audio/transcriptionsエンドポイントをコードの修正なしでそのまま置き換え可能。 - マルチエンジンの動的統合:Faster-Whisper、X-ASR (Zipformer)、Qwen3-ASR、FireRedASR を設定 1 行でプラグ&プレイ。
- ネイティブ VAD とスマート文分割:Silero-VAD 音声活動検出を深く統合し、無音ポーズによる文分割、長大ファイルのチャンク分割、ハルシネーション(異常な連続出力)の抑制をサポート。
- 100% のデータ完全保持・プライベート運用:ローカル Mac、プライベート GPU サーバー、または Kubernetes クラスタにデプロイ可能で、データが外部に流出する心配は一切ありません。
システムアーキテクチャ
[ クライアント & サードパーティ AI システム ] (DuRT, Dify, Open WebUI, Python SDK, cURL)
│
▼ (HTTP REST / WebSocket)
┌────────────────────────────────────────────────────────┐
│ OneASR Gateway (FastAPI) │
│ │
│ ┌───────────────────────┐ ┌───────────────────────┐ │
│ │ 認証 & API ルーティング │ │ ASR-Toolkit (VAD) │ │
│ │ • /v1/audio/* │ │ • Silero-VAD 音声検出 │ │
│ │ • /api/v1/stream │ │ • 動的タイムスライス分割 │ │
│ └───────────┬───────────┘ └───────────┬───────────┘ │
│ │ │ │
│ ▼ ▼ │
│ ┌──────────────────────────────────────────────────┐ │
│ │ エンジンレジストリ & リクエスト配信 │ │
│ └──────────────────────────┬───────────────────────┘ │
└─────────────────────────────┼──────────────────────────┘
│
┌────────────────────┼────────────────────┐
▼ ▼ ▼
┌──────────────────┐ ┌──────────────────┐ ┌──────────────────┐
│ Faster-Whisper │ │ X-ASR Zipformer │ │ Qwen3-ASR │
│ (多言語バッチ処理) │ │(超低遅延リアルタイム)│ │ (大規模モデル/高語彙)│
└──────────────────┘ └──────────────────┘ └──────────────────┘主な機能
- 超低遅延リアルタイムストリーミング:Zipformer2 Transducer アーキテクチャに基づき、160ms 未満のチャンク単位でのリアルタイムストリーミング認識をサポート。
- 非同期バッチ処理タスクキュー:数 GB クラスの長時間の音声・動画ファイルのアップロードに対応し、バックグラウンドのマルチワーカーによる非同期文字起こしと進捗ポーリングを提供。
- 単語レベルのミリ秒タイムスタンプ:字幕(SRT/VTT)を精密に同期し、動画クリエイターや会議議事録向けに高精度なタイムラインを生成。
- 内蔵 Vue 3 ビジュアルダッシュボード:セットアップ不要の Web ダッシュボードで、マイクによるオンラインテスト、モデルのベンチマーク測定、タスクキュー管理が可能。
クイックナビゲーション
- Docker コンテナデプロイ — NVIDIA GPU を活用して OneASR サービスを素早く起動。
- Python 手動セットアップ — Mac や Linux 環境で Python 実行環境を構築する方法。
- ハードウェア & GPU 加速 — CUDA、Apple Silicon Metal、および CPU マルチスレッドの最適化。
- 全体設定 (config.yaml) —
config.yamlの各設定項目の詳細解説。
