わずか数秒で独自のサーバーや Mac に産業用 ASR インフラを構築。Faster-Whisper、Zipformer (X-ASR)、Qwen-ASR、FireRedASR を集約し、OpenAI Audio API 規格に完全準拠。
個人の作業効率化から企業のセキュアなプライベート音声パイプラインまで対応。
/v1/audio/transcriptions をシームレスに代替。Dify、FastGPT、Open WebUI、DuRT、公式 SDK に即時接続可能。
シンプルな YAML 設定で Faster-Whisper、Zipformer (X-ASR)、Qwen-ASR、FireRedASR を柔軟にルーティング。
リアルタイム字幕、同時通訳、音声対話エージェント(Voice Agent)に最適なミリ秒単位の双方向音声ストリーム。
Silero-VAD 音声アクティビティ検出を統合。自然なポーズでの文分割、長尺音声の最適分割、幻覚(繰り返し)の自動除去。
マイク録音テスト、長尺ファイル文字起こし、GPU ステータス監視、タスクキュー管理が可能な洗練された UI。
すべての音声データはローカル/社内ネットワーク内に完結。第三者への転送やデータ流出の心配は一切ありません。
言語、遅延要件、ハードウェア性能に応じて最適な認識エンジンを選択できます。
| エンジン | タイプ | 対応言語 | 遅延 / RTF | ハードウェア加速 | 最適用途 |
|---|---|---|---|---|---|
| Faster-Whisperファイル処理推奨 | ファイル・バッチ文字起こし | 99以上の言語(多言語対応) | 0.12x - 0.25x RTF | CUDA, Metal, CPU (int8/fp16) | 長尺ファイル文字起こし、ポッドキャスト字幕生成、多言語翻訳 |
| X-ASR (Zipformer2)超低遅延首位 | リアルタイム音声認識 | 日本語・英語・中国語・混在 | < 160ms チャンク遅延 | CPU, ONNX, Metal, CUDA | 超低遅延リアルタイム字幕、会議同報、音声対話アシスタント |
| Qwen3-ASR (1.7B) | 大規模音声認識モデル | 30以上の言語・主要方言 | 0.15x - 0.35x RTF | CUDA (vLLM / PyTorch), Metal | 複雑な方言、ノイズ環境下での高精度認識、専門用語 |
| FireRedASR | エンタープライズ ASR | 中国語、英語 | 0.18x - 0.30x RTF | CUDA, PyTorch | ビジネス会議議事録、コンタクトセンター通話分析 |
音声入力、前処理、動的ルーティングから構造化出力までの標準フロー。
REST または WebSocket で音声を受信し、16kHz モノラルへ正規化。Silero-VAD により発話区間を検出。
リクエストの言語やレイテンシ要件に基づき、事前にメモリ展開された最適な ASR エンジンにルーティング。
音響モデルとデコーダが CUDA TensorRT や Metal の GPU 加速を活用し、ミリ秒単位のタイムスタンプを生成。
句読点補正と重複除去を行い、OpenAI 互換 JSON、SRT、VTT 形式でレスポンス。
使い慣れたツールと標準プロトコルで、わずか数行のコードで OneASR を統合。
from openai import OpenAI
# Initialize client pointing to your local OneASR gateway
client = OpenAI(
base_url="http://localhost:8000/v1",
api_key="sk-oneasr-v1-p_L3kXm9QZ8sT2vA4wE7rY1u"
)
# Transcribe audio file with word-level timestamps
with open("podcast.mp3", "rb") as audio_file:
transcript = client.audio.transcriptions.create(
model="faster-whisper",
file=audio_file,
response_format="verbose_json",
timestamp_granularities=["word", "segment"]
)
print(transcript.text)