Skip to content

OneASR プロジェクト概要とコアアーキテクチャ ​

OneASR は、オープンソースで高スループット・低遅延の音声認識(ASR)統合ゲートウェイおよびセルフホスト推論サービスフレームワークです。業界最先端の音声モデルを標準化し、統一された OpenAI Audio API 仕様およびミリ秒単位の全二重 WebSocket ストリーミングインターフェースとして提供します。


なぜ OneASR なのか? ​

最新の AI アプリケーションや音声対話エージェント(Voice Agent)の開発において、自前のプライベート音声認識基盤を構築する際には、インターフェースの断片化、標準的な VAD(音声活動検出)スライスコンポーネントの不足、複雑なモデルスケジューリング、そして商用クラウド API の高額なコストなどの課題に直面します。

OneASR は、これらの課題を解決するために設計されました:

  1. OpenAI 仕様に完全準拠:POST /v1/audio/transcriptions エンドポイントをコードの修正なしでそのまま置き換え可能。
  2. マルチエンジンの動的統合:Faster-Whisper、X-ASR (Zipformer)、Qwen3-ASR、FireRedASR を設定 1 行でプラグ&プレイ。
  3. ネイティブ VAD とスマート文分割:Silero-VAD 音声活動検出を深く統合し、無音ポーズによる文分割、長大ファイルのチャンク分割、ハルシネーション(異常な連続出力)の抑制をサポート。
  4. 100% のデータ完全保持・プライベート運用:ローカル Mac、プライベート GPU サーバー、または Kubernetes クラスタにデプロイ可能で、データが外部に流出する心配は一切ありません。

システムアーキテクチャ ​

[ クライアント & サードパーティ AI システム ] (DuRT, Dify, Open WebUI, Python SDK, cURL)
        │
        ▼ (HTTP REST / WebSocket)
┌────────────────────────────────────────────────────────┐
│                   OneASR Gateway (FastAPI)             │
│                                                        │
│  ┌───────────────────────┐  ┌───────────────────────┐  │
│  │   認証 & API ルーティング  │  │  ASR-Toolkit (VAD)    │  │
│  │  • /v1/audio/*        │  │  • Silero-VAD 音声検出 │  │
│  │  • /api/v1/stream     │  │  • 動的タイムスライス分割 │  │
│  └───────────┬───────────┘  └───────────┬───────────┘  │
│              │                          │              │
│              ▼                          ▼              │
│  ┌──────────────────────────────────────────────────┐  │
│  │            エンジンレジストリ & リクエスト配信         │  │
│  └──────────────────────────┬───────────────────────┘  │
└─────────────────────────────┼──────────────────────────┘
                              │
         ┌────────────────────┼────────────────────┐
         ▼                    ▼                    ▼
┌──────────────────┐ ┌──────────────────┐ ┌──────────────────┐
│  Faster-Whisper  │ │  X-ASR Zipformer │ │    Qwen3-ASR     │
│ (多言語バッチ処理) │ │(超低遅延リアルタイム)│ │ (大規模モデル/高語彙)│
└──────────────────┘ └──────────────────┘ └──────────────────┘

主な機能 ​

  • 超低遅延リアルタイムストリーミング:Zipformer2 Transducer アーキテクチャに基づき、160ms 未満のチャンク単位でのリアルタイムストリーミング認識をサポート。
  • 非同期バッチ処理タスクキュー:数 GB クラスの長時間の音声・動画ファイルのアップロードに対応し、バックグラウンドのマルチワーカーによる非同期文字起こしと進捗ポーリングを提供。
  • 単語レベルのミリ秒タイムスタンプ:字幕(SRT/VTT)を精密に同期し、動画クリエイターや会議議事録向けに高精度なタイムラインを生成。
  • 内蔵 Vue 3 ビジュアルダッシュボード:セットアップ不要の Web ダッシュボードで、マイクによるオンラインテスト、モデルのベンチマーク測定、タスクキュー管理が可能。

クイックナビゲーション ​