OneASR – Projektübersicht & Kernarchitektur
OneASR ist ein quelloffenes, hochgradig skalierbares Spracherkennungs-Gateway (ASR) mit minimaler Latenz und ein selbst gehostetes Inferenz-Framework. Es standardisiert moderne Spitzenmodelle der Spracherkennung in einer einheitlichen OpenAI Audio API-Spezifikation sowie einer vollduplexen WebSocket-Echtzeit-Streaming-Schnittstelle im Millisekundenbereich.
Warum OneASR?
Bei der Entwicklung moderner KI-Anwendungen und Sprachagenten (Voice Agents) steht man beim Aufbau eigener Spracherkennungssysteme oft vor fragmentierten Schnittstellen, fehlenden Standard-VAD-Segmentierungsmodulen, komplexer Modellorchestrierung und hohen Kosten für kommerzielle Cloud-APIs.
OneASR wurde speziell zur Lösung dieser Herausforderungen entwickelt:
- Vollständige OpenAI-Kompatibilität: Nahtloser Ersatz des Endpunkts
POST /v1/audio/transcriptionsohne Codeänderungen. - Dynamische Multi-Engine-Aggregation: Plug-and-Play-Unterstützung für Faster-Whisper, X-ASR (Zipformer), Qwen3-ASR und FireRedASR über eine einzige Konfigurationszeile.
- Natives VAD & Intelligente Segmentierung: Integrierte Silero-VAD-Sprachaktivitätserkennung mit automatischer Pausenerkennung, Chunking für große Dateien und Halluzinationsfilterung.
- 100% Datenkontrolle & Datenschutz: Bereitstellung auf lokalem Mac, privatem GPU-Server oder Kubernetes-Cluster – absolut kein Datenabfluss.
Systemarchitektur-Diagramm
[ Clients & Externe KI-Systeme ] (DuRT, Dify, Open WebUI, Python SDK, cURL)
│
▼ (HTTP REST / WebSocket)
┌────────────────────────────────────────────────────────┐
│ OneASR Gateway (FastAPI) │
│ │
│ ┌───────────────────────┐ ┌───────────────────────┐ │
│ │ Authentifizierung & │ │ ASR-Toolkit (VAD) │ │
│ │ API-Routing-Schicht │ │ • Silero-VAD Erkenn. │ │
│ │ • /v1/audio/* │ │ • Dynamisches │ │
│ │ • /api/v1/stream │ │ Slicing │ │
│ └───────────┬───────────┘ └───────────┬───────────┘ │
│ │ │ │
│ ▼ ▼ │
│ ┌──────────────────────────────────────────────────┐ │
│ │ Engine-Registry & Request-Dispatcher │ │
│ └──────────────────────────┬───────────────────────┘ │
└─────────────────────────────┼──────────────────────────┘
│
┌────────────────────┼────────────────────┐
▼ ▼ ▼
┌──────────────────┐ ┌──────────────────┐ ┌──────────────────┐
│ Faster-Whisper │ │ X-ASR Zipformer │ │ Qwen3-ASR │
│ (Mehrsprachige │ │ (Echtzeit-Stream │ │ (LLM-Sprachmodell│
│ Batch-Verarb.) │ │ Ultralow-Lat.) │ │ Hohe Präzision) │
└──────────────────┘ └──────────────────┘ └──────────────────┘Hauptfunktionen
- Ultraspontanes Echtzeit-Streaming: Basierend auf der Zipformer2-Transducer-Architektur mit Unterstützung für Streaming-Erkennung in 160ms-Blöcken.
- Asynchrone Batch-Warteschlange: Hochladen von mehrstündigen Audio- und Videodateien im Gigabyte-Bereich mit asynchroner Verarbeitung im Hintergrund und Fortschrittsabfrage.
- Millisekunden-Zeitstempel auf Wortebene: Präzise Ausrichtung für Untertitel (SRT/VTT) – ideal für Video-Ersteller und Besprechungsprotokolle.
- Integriertes Vue 3 Web-Dashboard: Sofort einsatzbereite Web-Benutzeroberfläche für Mikrofontests im Browser, Performance-Benchmarks und Warteschlangenverwaltung.
Schnellnavigation
- Docker Bereitstellung — OneASR blitzschnell mit NVIDIA-GPU-Unterstützung starten.
- Manuelle Python-Installation — Quellcode-Ausführung unter Mac oder Linux.
- Hardware-Beschleunigung — Optimierung für CUDA, Apple Silicon Metal und CPU-Multithreading.
- Konfiguration (config.yaml) — Ausführliche Erläuterung aller Konfigurationsparameter.
