Accélération Matérielle & Optimisation
OneASR est conçu pour tirer le meilleur parti de n’importe quel matériel disponible, des serveurs multi-GPU aux ordinateurs portables légers.
1. NVIDIA CUDA & TensorRT
Pour les charges de travail de serveur à haut débit, les GPU NVIDIA offrent la latence la plus faible et la concurrence la plus élevée.
Configuration Recommandée (config.yaml) :
yaml
ASR-Providers:
faster-whisper:
enable: true
load:
device: "cuda"
compute_type: "float16" # Ou "int8_float16" pour réduire l'usage de la VRAMTableau des Exigences VRAM :
| Modèle / Moteur | VRAM Minimale (int8) | VRAM Recommandée (fp16) | Concurrence (Flux Simultanés) |
|---|---|---|---|
| Faster-Whisper Tiny/Base | 1.0 Go | 2.0 Go | 20+ |
| Faster-Whisper Small/Medium | 2.5 Go | 5.0 Go | 8 - 12 |
| Faster-Whisper Large-v3 | 4.5 Go | 8.0 Go | 4 - 6 |
| X-ASR (Zipformer ONNX) | < 500 Mo | < 1.0 Go | 50+ |
| Qwen3-ASR (1.7B) | 3.5 Go | 6.0 Go | 4 - 8 |
2. Apple Silicon (M1 / M2 / M3 / M4)
OneASR tire parti de la mémoire unifiée et de Metal Performance Shaders (MPS) ou des instructions SIMD CPU optimisées sur macOS.
yaml
ASR-Providers:
faster-whisper:
enable: true
load:
device: "cpu"
compute_type: "int8" # Extrêmement rapide sur Apple Silicon avec 8+ cœurs CPUTIP
Sur les Mac Apple Silicon, exécuter Faster-Whisper avec compute_type: int8 et 4 threads CPU offre une vitesse supérieure à 4x en temps réel (RTF < 0.25) avec une consommation et une émission thermique quasi nulles.
3. Optimisation Multi-threads CPU
En cas d’exécution sans GPU dédié (par exemple sur un VPS standard ou dans un conteneur Docker) :
- Définissez
OMP_NUM_THREADSetCT2_USE_EXPERIMENTAL_PACKED_GEMM=1pour optimiser le calcul matriciel. - Utilisez la quantification
int8pour réduire la bande passante mémoire de 50 %.
