Unterstützte ASR-Engines im Überblick
OneASR setzt auf ein modulares Engine-Design (abstrakte Basisklasse BaseEngine), das Initialisierung, Inferenz und Ausgabeformatierung verschiedener Spracherkennungsmodelle vereinheitlicht.
Entscheidungshilfe zur Engine-Auswahl
mermaid
flowchart TD
Start[ASR Engine-Auswahl] --> Q1{Wird Echtzeit-Streaming benötigt?}
Q1 -- Ja (< 200ms) --> XASR[X-ASR / Zipformer2<br/>Erste Wahl für Millisekunden-Streaming]
Q1 -- Nein (Audio-/Videodateien) --> Q2{Sprache & Einsatzszenario?}
Q2 -- 99+ Sprachen / Podcasts / Video --> FW[Faster-Whisper<br/>Globale Allround-Lösung]
Q2 -- Komplexe Dialekte / Laute Umgebungen --> Qwen[Qwen3-ASR<br/>Großes Sprach-LLM]
Q2 -- Geschäftsprotokolle / Callcenter --> FR[FireRedASR<br/>Industrielle Präzision]Detaillierte Engine-Dokumentationen
- Faster-Whisper Engine — CTranslate2-basierte Hochgeschwindigkeits-Transkription für 99+ Sprachen.
- X-ASR Zipformer Echtzeit-Engine — Sherpa-ONNX-basierte Ultra-Low-Latency-Streaming-Erkennung.
- Qwen3-ASR Großes Sprachmodell — 1,7-Milliarden-Parameter-Sprachmodell mit starkem Kontextverständnis.
- FireRedASR Industrielle Engine — Hochpräzise ASR für Unternehmensanwendungen und Kundenservice.
