Skip to content

하드웨어 & GPU 가속 최적화 ​

OneASR은 다양한 컴퓨팅 하드웨어에 맞춰 최적화되어 있어, 멀티 GPU 서버부터 가벼운 노트북에 이르기까지 뛰어난 연산 효율을 발휘합니다.


1. NVIDIA CUDA & TensorRT ​

높은 동시 처리량과 고성능이 요구되는 서버 프로덕션 환경에서는 NVIDIA GPU 사용을 권장합니다:

yaml
ASR-Providers:
  faster-whisper:
    enable: true
    load:
      device: "cuda"
      compute_type: "float16" # VRAM이 제한적인 경우 int8_float16 설정 가능

VRAM 요구량 및 동시 처리 능력 비교표 ​

엔진 / 모델 규격최소 VRAM (int8)권장 VRAM (fp16)동시 처리 수용량
Faster-Whisper Tiny/Base1.0 GB2.0 GB20+ 동시 세션
Faster-Whisper Small/Medium2.5 GB5.0 GB8 - 12 동시 세션
Faster-Whisper Large-v34.5 GB8.0 GB4 - 6 동시 세션
X-ASR (Zipformer ONNX)< 500 MB< 1.0 GB50+ 동시 세션
Qwen3-ASR (1.7B)3.5 GB6.0 GB4 - 8 동시 세션

2. Apple Silicon (M1 / M2 / M3 / M4) ​

macOS 기기에서 OneASR은 통합 메모리(Unified Memory)와 Apple Silicon 고성능 CPU 코어를 효과적으로 활용합니다:

yaml
ASR-Providers:
  faster-whisper:
    enable: true
    load:
      device: "cpu"
      compute_type: "int8"

TIP

Apple Silicon 칩이 탑재된 Mac에서는 int8 양자화와 4개의 CPU 스레드를 적용할 경우 **실시간 대비 4배 이상의 전사 속도(RTF < 0.25)**를 달성하면서도 전력 소모와 발열이 매우 낮습니다.