Aceleración por Hardware y Optimización
OneASR está diseñado para extraer el máximo rendimiento de cualquier hardware disponible, desde clústeres de servidores multi-GPU hasta portátiles de bajo consumo.
1. NVIDIA CUDA & TensorRT
Para cargas de trabajo de servidor de alto rendimiento, las GPUs NVIDIA ofrecen la menor latencia y la mayor concurrencia.
Configuración Recomendada (config.yaml):
yaml
ASR-Providers:
faster-whisper:
enable: true
load:
device: "cuda"
compute_type: "float16" # O "int8_float16" para menor uso de VRAMTabla de Requisitos de VRAM:
| Modelo / Motor | VRAM Mínima (int8) | VRAM Recomendada (fp16) | Concurrencia (Flujos Simultáneos) |
|---|---|---|---|
| Faster-Whisper Tiny/Base | 1.0 GB | 2.0 GB | 20+ |
| Faster-Whisper Small/Medium | 2.5 GB | 5.0 GB | 8 - 12 |
| Faster-Whisper Large-v3 | 4.5 GB | 8.0 GB | 4 - 6 |
| X-ASR (Zipformer ONNX) | < 500 MB | < 1.0 GB | 50+ |
| Qwen3-ASR (1.7B) | 3.5 GB | 6.0 GB | 4 - 8 |
2. Apple Silicon (M1 / M2 / M3 / M4)
OneASR aprovecha la memoria unificada y Metal Performance Shaders (MPS) o SIMD de CPU optimizado en macOS.
yaml
ASR-Providers:
faster-whisper:
enable: true
load:
device: "cpu"
compute_type: "int8" # Extremadamente rápido en Apple Silicon con 8+ núcleos de CPUTIP
En Macs con Apple Silicon, ejecutar Faster-Whisper con compute_type: int8 y 4 hilos de CPU ofrece una velocidad de más de 4x en tiempo real (RTF < 0.25) con un consumo de energía y temperatura mínimos.
3. Optimización Multihilo en CPU
Cuando se ejecuta sin GPUs dedicadas (por ejemplo, en un VPS estándar o contenedor Docker):
- Configure
OMP_NUM_THREADSyCT2_USE_EXPERIMENTAL_PACKED_GEMM=1para un cálculo matricial óptimo. - Utilice cuantización
int8para reducir el ancho de banda de memoria en un 50%.
