Skip to content

全局配置详解 (config.yaml) ​

OneASR 的所有服务行为、VAD 策略与引擎加载均由项目根目录下的 config.yaml 集中管理。


配置文件完整示例 ​

yaml
# OneASR 统一配置文件

# 主 API Key(所有接口鉴权所需)
api_key: sk-oneasr-v1-p_L3kXm9QZ8sT2vA4wE7rY1u

# ASR Toolkit 音频预处理与 VAD 切片参数
ASR-Toolkit:
  vad:
    model: "silero_vad"          # VAD 模型类型: silero_vad
    threshold: 0.5               # 语音置信度阈值 (0.0~1.0)
    min_speech_duration_ms: 250  # 最小语音段时长 (ms)
    min_silence_duration_ms: 300 # 静音断句停顿时长 (ms)
    padding_ms: 100              # 前后缓冲填充 (ms)

  chunking:
    target_chunk_duration: 6.0   # 理想字幕/切片时长 (秒)
    max_chunk_duration: 8.0      # 最大切片时长硬上限 (秒)
    min_pause_duration: 0.4      # 自然断句停顿阈值 (秒)
    min_sentence_duration: 2.0   # 触发断句最小语义时长 (秒)

  post_process:
    remove_repeats: true         # 过滤连续复读幻觉
    normalize_text: true         # 标点与空格规范化

# 引擎提供者配置
ASR-Providers:

  # 1. 实时流式识别引擎 (Sherpa-ONNX Zipformer)
  xasr:
    enable: true
    engine: xasr
    load:
      model_name: xasr-zh-en
      tokens_path: models/chunk-160ms-model/tokens.txt
      encoder_path: models/chunk-160ms-model/encoder-160ms.onnx
      decoder_path: models/chunk-160ms-model/decoder-160ms.onnx
      joiner_path: models/chunk-160ms-model/joiner-160ms.onnx
      provider: cpu
      sample_rate: 16000
      decoding_method: greedy_search
    properties:
      categories:
        - RealtimeASR
      languages: zh, en

  # 2. Faster-Whisper 文件转录
  faster-whisper:
    enable: true
    engine: faster-whisper
    load:
      model_name: medium
      model_path: models/faster-whisper-medium
      device: cuda # 或 cpu
      compute_type: float16 # 或 int8
    properties:
      categories:
        - FileASR
      languages: zh, en, ja, ko, fr, de, es, it, ru, pt