Bereitstellung industrieller ASR-Infrastruktur auf eigenen Servern oder dem Mac in Sekundenschnelle. Aggregation von Faster-Whisper, Zipformer, Qwen-ASR und FireRedASR mit vollständiger OpenAI-Audio-API-Kompatibilität.
Alles, was Sie für hochvolumige, private Sprachtranskriptions-Pipelines benötigen.
Direkter Ersatz für /v1/audio/transcriptions. Nahtlose Anbindung an Dify, FastGPT, Open WebUI, DuRT und offizielle SDKs.
Dynamisches Routing über Faster-Whisper, Zipformer (X-ASR), Qwen-ASR und FireRedASR via intuitiver YAML-Konfiguration.
Vollduplex-WebSocket-Audioprotokoll für Live-Untertitel im Sub-Sekunden-Bereich, Meetings und Sprach-Assistenten.
Silero-VAD-gestützte Spracherkennung mit automatischer Pausensegmentierung und Halluzinationsfilterung.
Interaktive Weboberfläche zum Testen von Mikrofonaufnahmen, Datei-Uploads, GPU-Überwachung und Task-Queues.
Sämtliche Audiodaten verbleiben vollständig in Ihrer eigenen Infrastruktur. Keine Drittanbieter-Telemetrie oder Weiterleitung.
Wählen Sie die ideale Engine abgestimmt auf Sprache, Latenzanforderung und Hardware.
| Engine | Typ | Unterstützte Sprachen | Latenz / RTF | Hardware-Beschleunigung | Bester Anwendungsfall |
|---|---|---|---|---|---|
| Faster-WhisperEmpfohlen für Dateien | Datei- & Batch-Transkription | 99+ Sprachen (Mehrsprachig) | 0.12x - 0.25x RTF | CUDA, Metal, CPU (int8/fp16) | Mehrsprachige Dateitranskription, Podcast-Verarbeitung, Untertitelung |
| X-ASR (Zipformer2)Geringste Latenz | Echtzeit-Streaming | Deutsch, Englisch, Chinesisch | < 160ms Chunk-Verzögerung | CPU, ONNX, Metal, CUDA | Extrem latenzarme Live-Untertitel, Simultanübersetzung, Sprachassistenten |
| Qwen3-ASR (1.7B) | LLM-Spracherkennung | 30+ Sprachen & Dialekte | 0.15x - 0.35x RTF | CUDA (vLLM / PyTorch), Metal | Dialekte, geräuschintensive Umgebungen, Fachbegriffe |
| FireRedASR | Industrielle ASR | Englisch, Chinesisch | 0.18x - 0.30x RTF | CUDA, PyTorch | Unternehmensprotokolle und Callcenter-Analysen |
Standardisierte Architektur von der Audioaufnahme bis zur strukturierten Ausgabe.
Audioeingang via REST/WebSocket, Normalisierung auf 16kHz Mono und Segmentierung durch Silero-VAD.
Routing an vorbereitete Engine-Instanzen basierend auf Sprach- und Latenzparametern.
GPU-beschleunigte Inferenz mit CUDA TensorRT oder Apple Metal zur präzisen Zeitstempel-Erzeugung.
Satzzeichen-Optimierung, Dubletten-Filterung und Ausgabe in OpenAI-JSON, SRT oder VTT.
Integrieren Sie OneASR mit wenigen Codezeilen über bekannte Standards.
from openai import OpenAI
# Initialize client pointing to your local OneASR gateway
client = OpenAI(
base_url="http://localhost:8000/v1",
api_key="sk-oneasr-v1-p_L3kXm9QZ8sT2vA4wE7rY1u"
)
# Transcribe audio file with word-level timestamps
with open("podcast.mp3", "rb") as audio_file:
transcript = client.audio.transcriptions.create(
model="faster-whisper",
file=audio_file,
response_format="verbose_json",
timestamp_granularities=["word", "segment"]
)
print(transcript.text)