하드웨어 & GPU 가속 최적화
OneASR은 다양한 컴퓨팅 하드웨어에 맞춰 최적화되어 있어, 멀티 GPU 서버부터 가벼운 노트북에 이르기까지 뛰어난 연산 효율을 발휘합니다.
1. NVIDIA CUDA & TensorRT
높은 동시 처리량과 고성능이 요구되는 서버 프로덕션 환경에서는 NVIDIA GPU 사용을 권장합니다:
yaml
ASR-Providers:
faster-whisper:
enable: true
load:
device: "cuda"
compute_type: "float16" # VRAM이 제한적인 경우 int8_float16 설정 가능VRAM 요구량 및 동시 처리 능력 비교표
| 엔진 / 모델 규격 | 최소 VRAM (int8) | 권장 VRAM (fp16) | 동시 처리 수용량 |
|---|---|---|---|
| Faster-Whisper Tiny/Base | 1.0 GB | 2.0 GB | 20+ 동시 세션 |
| Faster-Whisper Small/Medium | 2.5 GB | 5.0 GB | 8 - 12 동시 세션 |
| Faster-Whisper Large-v3 | 4.5 GB | 8.0 GB | 4 - 6 동시 세션 |
| X-ASR (Zipformer ONNX) | < 500 MB | < 1.0 GB | 50+ 동시 세션 |
| Qwen3-ASR (1.7B) | 3.5 GB | 6.0 GB | 4 - 8 동시 세션 |
2. Apple Silicon (M1 / M2 / M3 / M4)
macOS 기기에서 OneASR은 통합 메모리(Unified Memory)와 Apple Silicon 고성능 CPU 코어를 효과적으로 활용합니다:
yaml
ASR-Providers:
faster-whisper:
enable: true
load:
device: "cpu"
compute_type: "int8"TIP
Apple Silicon 칩이 탑재된 Mac에서는 int8 양자화와 4개의 CPU 스레드를 적용할 경우 **실시간 대비 4배 이상의 전사 속도(RTF < 0.25)**를 달성하면서도 전력 소모와 발열이 매우 낮습니다.
