全体設定 (config.yaml)
OneASR のすべてのサービス動作、VAD ポリシー、およびエンジンの読み込みは、プロジェクトルートにある config.yaml で一元管理されます。
設定ファイルの完全な例
yaml
# OneASR 統合設定ファイル
# メイン API キー(すべての API 認証に必要)
api_key: sk-oneasr-v1-p_L3kXm9QZ8sT2vA4wE7rY1u
# ASR Toolkit 音声前処理および VAD チャンク分割パラメータ
ASR-Toolkit:
vad:
model: "silero_vad" # VAD モデルタイプ: silero_vad
threshold: 0.5 # 音声信頼度しきい値 (0.0~1.0)
min_speech_duration_ms: 250 # 最小発話区間長 (ms)
min_silence_duration_ms: 300 # 文分割の無音ポーズ時間 (ms)
padding_ms: 100 # 前後バッファパディング (ms)
chunking:
target_chunk_duration: 6.0 # 理想的な字幕/チャンク長 (秒)
max_chunk_duration: 8.0 # 最大チャンク長の上限 (秒)
min_pause_duration: 0.4 # 自然な文分割のポーズしきい値 (秒)
min_sentence_duration: 2.0 # 文分割を発動する最小セマンティック時間 (秒)
post_process:
remove_repeats: true # 連続リピート(ハルシネーション)をフィルタリング
normalize_text: true # 句読点と空白の正規化
# エンジンプロバイダー設定
ASR-Providers:
# 1. リアルタイムストリーミング認識エンジン (Sherpa-ONNX Zipformer)
xasr:
enable: true
engine: xasr
load:
model_name: xasr-zh-en
tokens_path: models/chunk-160ms-model/tokens.txt
encoder_path: models/chunk-160ms-model/encoder-160ms.onnx
decoder_path: models/chunk-160ms-model/decoder-160ms.onnx
joiner_path: models/chunk-160ms-model/joiner-160ms.onnx
provider: cpu
sample_rate: 16000
decoding_method: greedy_search
properties:
categories:
- RealtimeASR
languages: zh, en
# 2. Faster-Whisper ファイル文字起こし
faster-whisper:
enable: true
engine: faster-whisper
load:
model_name: medium
model_path: models/faster-whisper-medium
device: cuda # または cpu
compute_type: float16 # または int8
properties:
categories:
- FileASR
languages: zh, en, ja, ko, fr, de, es, it, ru, pt