Skip to content

Accélération Matérielle & Optimisation ​

OneASR est conçu pour tirer le meilleur parti de n’importe quel matériel disponible, des serveurs multi-GPU aux ordinateurs portables légers.


1. NVIDIA CUDA & TensorRT ​

Pour les charges de travail de serveur à haut débit, les GPU NVIDIA offrent la latence la plus faible et la concurrence la plus élevée.

Configuration Recommandée (config.yaml) : ​

yaml
ASR-Providers:
  faster-whisper:
    enable: true
    load:
      device: "cuda"
      compute_type: "float16" # Ou "int8_float16" pour réduire l'usage de la VRAM

Tableau des Exigences VRAM : ​

Modèle / MoteurVRAM Minimale (int8)VRAM Recommandée (fp16)Concurrence (Flux Simultanés)
Faster-Whisper Tiny/Base1.0 Go2.0 Go20+
Faster-Whisper Small/Medium2.5 Go5.0 Go8 - 12
Faster-Whisper Large-v34.5 Go8.0 Go4 - 6
X-ASR (Zipformer ONNX)< 500 Mo< 1.0 Go50+
Qwen3-ASR (1.7B)3.5 Go6.0 Go4 - 8

2. Apple Silicon (M1 / M2 / M3 / M4) ​

OneASR tire parti de la mémoire unifiée et de Metal Performance Shaders (MPS) ou des instructions SIMD CPU optimisées sur macOS.

yaml
ASR-Providers:
  faster-whisper:
    enable: true
    load:
      device: "cpu"
      compute_type: "int8" # Extrêmement rapide sur Apple Silicon avec 8+ cœurs CPU

TIP

Sur les Mac Apple Silicon, exécuter Faster-Whisper avec compute_type: int8 et 4 threads CPU offre une vitesse supérieure à 4x en temps réel (RTF < 0.25) avec une consommation et une émission thermique quasi nulles.


3. Optimisation Multi-threads CPU ​

En cas d’exécution sans GPU dédié (par exemple sur un VPS standard ou dans un conteneur Docker) :

  • Définissez OMP_NUM_THREADS et CT2_USE_EXPERIMENTAL_PACKED_GEMM=1 pour optimiser le calcul matriciel.
  • Utilisez la quantification int8 pour réduire la bande passante mémoire de 50 %.