Skip to content

환경 설정 상세 가이드 (config.yaml) ​

OneASR의 모든 서비스 동작, VAD 전략 및 엔진 로딩은 프로젝트 루트 경로의 config.yaml 파일에서 통합 관리됩니다.


구성 파일 전체 예시 ​

yaml
# OneASR 통합 구성 파일

# 메인 API Key (모든 엔드포인트 인증에 필요)
api_key: sk-oneasr-v1-p_L3kXm9QZ8sT2vA4wE7rY1u

# ASR Toolkit 오디오 전처리 및 VAD 청킹 매개변수
ASR-Toolkit:
  vad:
    model: "silero_vad"          # VAD 모델 유형: silero_vad
    threshold: 0.5               # 음성 신뢰도 임계값 (0.0~1.0)
    min_speech_duration_ms: 250  # 최소 음성 지속 시간 (ms)
    min_silence_duration_ms: 300 # 묵음 분할 정지 지속 시간 (ms)
    padding_ms: 100              # 앞뒤 버퍼 패딩 (ms)

  chunking:
    target_chunk_duration: 6.0   # 이상적인 자막/청크 길이 (초)
    max_chunk_duration: 8.0      # 최대 청크 길이 상한 (초)
    min_pause_duration: 0.4      # 자연스러운 문장 분할 묵음 임계값 (초)
    min_sentence_duration: 2.0   # 문장 분할 트리거 최소 의미 지속 시간 (초)

  post_process:
    remove_repeats: true         # 연속 반복 환각 필터링
    normalize_text: true         # 구두점 및 공백 정규화

# ASR 엔진 프로바이더 설정
ASR-Providers:

  # 1. 실시간 스트리밍 인식 엔진 (Sherpa-ONNX Zipformer)
  xasr:
    enable: true
    engine: xasr
    load:
      model_name: xasr-zh-en
      tokens_path: models/chunk-160ms-model/tokens.txt
      encoder_path: models/chunk-160ms-model/encoder-160ms.onnx
      decoder_path: models/chunk-160ms-model/decoder-160ms.onnx
      joiner_path: models/chunk-160ms-model/joiner-160ms.onnx
      provider: cpu
      sample_rate: 16000
      decoding_method: greedy_search
    properties:
      categories:
        - RealtimeASR
      languages: zh, en

  # 2. Faster-Whisper 파일 전사 엔진
  faster-whisper:
    enable: true
    engine: faster-whisper
    load:
      model_name: medium
      model_path: models/faster-whisper-medium
      device: cuda # 또는 cpu
      compute_type: float16 # 또는 int8
    properties:
      categories:
        - FileASR
      languages: zh, en, ja, ko, fr, de, es, it, ru, pt