Skip to content

OneASR – Projektübersicht & Kernarchitektur ​

OneASR ist ein quelloffenes, hochgradig skalierbares Spracherkennungs-Gateway (ASR) mit minimaler Latenz und ein selbst gehostetes Inferenz-Framework. Es standardisiert moderne Spitzenmodelle der Spracherkennung in einer einheitlichen OpenAI Audio API-Spezifikation sowie einer vollduplexen WebSocket-Echtzeit-Streaming-Schnittstelle im Millisekundenbereich.


Warum OneASR? ​

Bei der Entwicklung moderner KI-Anwendungen und Sprachagenten (Voice Agents) steht man beim Aufbau eigener Spracherkennungssysteme oft vor fragmentierten Schnittstellen, fehlenden Standard-VAD-Segmentierungsmodulen, komplexer Modellorchestrierung und hohen Kosten für kommerzielle Cloud-APIs.

OneASR wurde speziell zur Lösung dieser Herausforderungen entwickelt:

  1. Vollständige OpenAI-Kompatibilität: Nahtloser Ersatz des Endpunkts POST /v1/audio/transcriptions ohne Codeänderungen.
  2. Dynamische Multi-Engine-Aggregation: Plug-and-Play-Unterstützung für Faster-Whisper, X-ASR (Zipformer), Qwen3-ASR und FireRedASR über eine einzige Konfigurationszeile.
  3. Natives VAD & Intelligente Segmentierung: Integrierte Silero-VAD-Sprachaktivitätserkennung mit automatischer Pausenerkennung, Chunking für große Dateien und Halluzinationsfilterung.
  4. 100% Datenkontrolle & Datenschutz: Bereitstellung auf lokalem Mac, privatem GPU-Server oder Kubernetes-Cluster – absolut kein Datenabfluss.

Systemarchitektur-Diagramm ​

[ Clients & Externe KI-Systeme ] (DuRT, Dify, Open WebUI, Python SDK, cURL)
        │
        ▼ (HTTP REST / WebSocket)
┌────────────────────────────────────────────────────────┐
│                   OneASR Gateway (FastAPI)             │
│                                                        │
│  ┌───────────────────────┐  ┌───────────────────────┐  │
│  │ Authentifizierung &   │  │  ASR-Toolkit (VAD)    │  │
│  │ API-Routing-Schicht   │  │  • Silero-VAD Erkenn. │  │
│  │ • /v1/audio/*         │  │  • Dynamisches        │  │
│  │ • /api/v1/stream      │  │    Slicing            │  │
│  └───────────┬───────────┘  └───────────┬───────────┘  │
│              │                          │              │
│              ▼                          ▼              │
│  ┌──────────────────────────────────────────────────┐  │
│  │         Engine-Registry & Request-Dispatcher     │  │
│  └──────────────────────────┬───────────────────────┘  │
└─────────────────────────────┼──────────────────────────┘
                              │
         ┌────────────────────┼────────────────────┐
         ▼                    ▼                    ▼
┌──────────────────┐ ┌──────────────────┐ ┌──────────────────┐
│  Faster-Whisper  │ │  X-ASR Zipformer │ │    Qwen3-ASR     │
│ (Mehrsprachige   │ │ (Echtzeit-Stream │ │ (LLM-Sprachmodell│
│  Batch-Verarb.)  │ │  Ultralow-Lat.)  │ │  Hohe Präzision) │
└──────────────────┘ └──────────────────┘ └──────────────────┘

Hauptfunktionen ​

  • Ultraspontanes Echtzeit-Streaming: Basierend auf der Zipformer2-Transducer-Architektur mit Unterstützung für Streaming-Erkennung in 160ms-Blöcken.
  • Asynchrone Batch-Warteschlange: Hochladen von mehrstündigen Audio- und Videodateien im Gigabyte-Bereich mit asynchroner Verarbeitung im Hintergrund und Fortschrittsabfrage.
  • Millisekunden-Zeitstempel auf Wortebene: Präzise Ausrichtung für Untertitel (SRT/VTT) – ideal für Video-Ersteller und Besprechungsprotokolle.
  • Integriertes Vue 3 Web-Dashboard: Sofort einsatzbereite Web-Benutzeroberfläche für Mikrofontests im Browser, Performance-Benchmarks und Warteschlangenverwaltung.

Schnellnavigation ​