Skip to content

Hardware-Beschleunigung & GPU-Tuning ​

OneASR ist für eine Vielzahl von Rechenarchitekturen optimiert – von Multi-GPU-Servern bis hin zu schlanken Laptops erzielen Sie herausragende Recheneffizienz.


1. NVIDIA CUDA & TensorRT ​

Für Produktionsserver mit hoher Parallelität und Durchsatzanforderungen wird eine NVIDIA-GPU empfohlen:

yaml
ASR-Providers:
  faster-whisper:
    enable: true
    load:
      device: "cuda"
      compute_type: "float16" # Bei knappem VRAM auf int8_float16 setzen

VRAM-Bedarf und Parallelitätstabelle ​

Engine / ModellspezifikationMin. VRAM (int8)Empf. VRAM (fp16)Parallele Streams
Faster-Whisper Tiny/Base1.0 GB2.0 GB20+ parallele Anfragen
Faster-Whisper Small/Medium2.5 GB5.0 GB8 - 12 parallele Anfragen
Faster-Whisper Large-v34.5 GB8.0 GB4 - 6 parallele Anfragen
X-ASR (Zipformer ONNX)< 500 MB< 1.0 GB50+ parallele Anfragen
Qwen3-ASR (1.7B)3.5 GB6.0 GB4 - 8 parallele Anfragen

2. Apple Silicon (M1 / M2 / M3 / M4) ​

Auf macOS-Geräten nutzt OneASR den einheitlichen Speicher (Unified Memory) und die leistungsstarken CPU-Kerne von Apple Silicon:

yaml
ASR-Providers:
  faster-whisper:
    enable: true
    load:
      device: "cpu"
      compute_type: "int8"

TIP

Auf Macs mit Apple Silicon Chips liefert die int8-Quantisierung mit 4 CPU-Threads eine mehr als 4-fache Echtzeitgeschwindigkeit (RTF < 0,25) bei minimaler Leistungsaufnahme und Wärmeentwicklung.