Hardware-Beschleunigung & GPU-Tuning
OneASR ist für eine Vielzahl von Rechenarchitekturen optimiert – von Multi-GPU-Servern bis hin zu schlanken Laptops erzielen Sie herausragende Recheneffizienz.
1. NVIDIA CUDA & TensorRT
Für Produktionsserver mit hoher Parallelität und Durchsatzanforderungen wird eine NVIDIA-GPU empfohlen:
yaml
ASR-Providers:
faster-whisper:
enable: true
load:
device: "cuda"
compute_type: "float16" # Bei knappem VRAM auf int8_float16 setzenVRAM-Bedarf und Parallelitätstabelle
| Engine / Modellspezifikation | Min. VRAM (int8) | Empf. VRAM (fp16) | Parallele Streams |
|---|---|---|---|
| Faster-Whisper Tiny/Base | 1.0 GB | 2.0 GB | 20+ parallele Anfragen |
| Faster-Whisper Small/Medium | 2.5 GB | 5.0 GB | 8 - 12 parallele Anfragen |
| Faster-Whisper Large-v3 | 4.5 GB | 8.0 GB | 4 - 6 parallele Anfragen |
| X-ASR (Zipformer ONNX) | < 500 MB | < 1.0 GB | 50+ parallele Anfragen |
| Qwen3-ASR (1.7B) | 3.5 GB | 6.0 GB | 4 - 8 parallele Anfragen |
2. Apple Silicon (M1 / M2 / M3 / M4)
Auf macOS-Geräten nutzt OneASR den einheitlichen Speicher (Unified Memory) und die leistungsstarken CPU-Kerne von Apple Silicon:
yaml
ASR-Providers:
faster-whisper:
enable: true
load:
device: "cpu"
compute_type: "int8"TIP
Auf Macs mit Apple Silicon Chips liefert die int8-Quantisierung mit 4 CPU-Threads eine mehr als 4-fache Echtzeitgeschwindigkeit (RTF < 0,25) bei minimaler Leistungsaufnahme und Wärmeentwicklung.
