Skip to content

Aceleración por Hardware y Optimización ​

OneASR está diseñado para extraer el máximo rendimiento de cualquier hardware disponible, desde clústeres de servidores multi-GPU hasta portátiles de bajo consumo.


1. NVIDIA CUDA & TensorRT ​

Para cargas de trabajo de servidor de alto rendimiento, las GPUs NVIDIA ofrecen la menor latencia y la mayor concurrencia.

Configuración Recomendada (config.yaml): ​

yaml
ASR-Providers:
  faster-whisper:
    enable: true
    load:
      device: "cuda"
      compute_type: "float16" # O "int8_float16" para menor uso de VRAM

Tabla de Requisitos de VRAM: ​

Modelo / MotorVRAM Mínima (int8)VRAM Recomendada (fp16)Concurrencia (Flujos Simultáneos)
Faster-Whisper Tiny/Base1.0 GB2.0 GB20+
Faster-Whisper Small/Medium2.5 GB5.0 GB8 - 12
Faster-Whisper Large-v34.5 GB8.0 GB4 - 6
X-ASR (Zipformer ONNX)< 500 MB< 1.0 GB50+
Qwen3-ASR (1.7B)3.5 GB6.0 GB4 - 8

2. Apple Silicon (M1 / M2 / M3 / M4) ​

OneASR aprovecha la memoria unificada y Metal Performance Shaders (MPS) o SIMD de CPU optimizado en macOS.

yaml
ASR-Providers:
  faster-whisper:
    enable: true
    load:
      device: "cpu"
      compute_type: "int8" # Extremadamente rápido en Apple Silicon con 8+ núcleos de CPU

TIP

En Macs con Apple Silicon, ejecutar Faster-Whisper con compute_type: int8 y 4 hilos de CPU ofrece una velocidad de más de 4x en tiempo real (RTF < 0.25) con un consumo de energía y temperatura mínimos.


3. Optimización Multihilo en CPU ​

Cuando se ejecuta sin GPUs dedicadas (por ejemplo, en un VPS estándar o contenedor Docker):

  • Configure OMP_NUM_THREADS y CT2_USE_EXPERIMENTAL_PACKED_GEMM=1 para un cálculo matricial óptimo.
  • Utilice cuantización int8 para reducir el ancho de banda de memoria en un 50%.