対応 ASR エンジンの機能概要
OneASR はモジュール型エンジン設計(BaseEngine 抽象クラス)を採用しており、多様な音声認識モデルの初期化、推論呼び出し、および出力の標準化を統一しています。
エンジン選定フロー
mermaid
flowchart TD
Start[ASR エンジンの選定] --> Q1{超低遅延リアルタイムストリーミングが必要?}
Q1 -- はい (< 200ms) --> XASR[X-ASR / Zipformer2<br/>ミリ秒級リアルタイムストリーミングの最適解]
Q1 -- いいえ (長時間の音声/動画ファイル) --> Q2{言語と利用シナリオは?}
Q2 -- 99+ 言語 / ポッドキャスト / 動画 --> FW[Faster-Whisper<br/>グローバル多言語対応の標準]
Q2 -- 複雑な方言 / 騒音環境 --> Qwen[Qwen3-ASR<br/>大規模音声基盤モデル]
Q2 -- 企業会議議事録 / コールセンター --> FR[FireRedASR<br/>高精度な産業向け中国語]詳細設定ドキュメント
- Faster-Whisper エンジン設定 — CTranslate2 をベースとした超高速多言語文字起こしエンジン。
- X-ASR Zipformer リアルタイムストリーミングエンジン — Sherpa-ONNX をベースとした低遅延ストリーミング文字起こし。
- Qwen3-ASR 大規模音声認識モデル — 1.7B パラメータの大規模音声基盤モデル。
- FireRedASR 産業向け中国語認識 — 標準中国語および電話カスタマーサポートに最適化された高精度エンジン。
