Skip to content

全体設定 (config.yaml) ​

OneASR のすべてのサービス動作、VAD ポリシー、およびエンジンの読み込みは、プロジェクトルートにある config.yaml で一元管理されます。


設定ファイルの完全な例 ​

yaml
# OneASR 統合設定ファイル

# メイン API キー(すべての API 認証に必要)
api_key: sk-oneasr-v1-p_L3kXm9QZ8sT2vA4wE7rY1u

# ASR Toolkit 音声前処理および VAD チャンク分割パラメータ
ASR-Toolkit:
  vad:
    model: "silero_vad"          # VAD モデルタイプ: silero_vad
    threshold: 0.5               # 音声信頼度しきい値 (0.0~1.0)
    min_speech_duration_ms: 250  # 最小発話区間長 (ms)
    min_silence_duration_ms: 300 # 文分割の無音ポーズ時間 (ms)
    padding_ms: 100              # 前後バッファパディング (ms)

  chunking:
    target_chunk_duration: 6.0   # 理想的な字幕/チャンク長 (秒)
    max_chunk_duration: 8.0      # 最大チャンク長の上限 (秒)
    min_pause_duration: 0.4      # 自然な文分割のポーズしきい値 (秒)
    min_sentence_duration: 2.0   # 文分割を発動する最小セマンティック時間 (秒)

  post_process:
    remove_repeats: true         # 連続リピート(ハルシネーション)をフィルタリング
    normalize_text: true         # 句読点と空白の正規化

# エンジンプロバイダー設定
ASR-Providers:

  # 1. リアルタイムストリーミング認識エンジン (Sherpa-ONNX Zipformer)
  xasr:
    enable: true
    engine: xasr
    load:
      model_name: xasr-zh-en
      tokens_path: models/chunk-160ms-model/tokens.txt
      encoder_path: models/chunk-160ms-model/encoder-160ms.onnx
      decoder_path: models/chunk-160ms-model/decoder-160ms.onnx
      joiner_path: models/chunk-160ms-model/joiner-160ms.onnx
      provider: cpu
      sample_rate: 16000
      decoding_method: greedy_search
    properties:
      categories:
        - RealtimeASR
      languages: zh, en

  # 2. Faster-Whisper ファイル文字起こし
  faster-whisper:
    enable: true
    engine: faster-whisper
    load:
      model_name: medium
      model_path: models/faster-whisper-medium
      device: cuda # または cpu
      compute_type: float16 # または int8
    properties:
      categories:
        - FileASR
      languages: zh, en, ja, ko, fr, de, es, it, ru, pt