Déployez une infrastructure ASR de niveau industriel sur vos serveurs ou votre Mac en quelques secondes. Agrégez Faster-Whisper, Zipformer, Qwen-ASR et FireRedASR avec une compatibilité totale avec l’API OpenAI Audio.
Tout ce dont vous avez besoin pour vos flux de transcription vocale privés et à haut débit.
Remplacement direct pour /v1/audio/transcriptions. Connexion transparente avec Dify, FastGPT, Open WebUI, DuRT et les SDKs officiels.
Acheminement dynamique vers Faster-Whisper, Zipformer (X-ASR), Qwen-ASR et FireRedASR via une configuration YAML claire.
Protocole audio WebSocket duplex intégral pour sous-titrage en temps réel, réunions et agents vocaux interactifs.
Détection d’activité vocale Silero-VAD, découpage basé sur les pauses naturelles et suppression des hallucinations.
Interface web pour tester le micro, téléverser de longs fichiers, surveiller le GPU et suivre les tâches.
Toutes les données audio restent au sein de votre infrastructure. Zéro télémétrie ni fuite de données vers des tiers.
Sélectionnez le meilleur moteur en fonction de la langue, de la latence et de votre matériel.
| Moteur | Type | Langues Supportées | Latence / RTF | Accélération Matérielle | Cas d’Usage Idéal |
|---|---|---|---|---|---|
| Faster-WhisperRecommandé Fichiers | Transcription de Fichiers & Lots | 99+ Langues (Multilingue) | 0.12x - 0.25x RTF | CUDA, Metal, CPU (int8/fp16) | Transcription de fichiers longs, podcasts et sous-titrage automatisé |
| X-ASR (Zipformer2)Latence Minimale | Streaming Temps Réel | Français, Anglais, Chinois | < 160ms délai par bloc | CPU, ONNX, Metal, CUDA | Sous-titrage direct à latence minimale et assistants vocaux |
| Qwen3-ASR (1.7B) | Reconnaissance Basée sur LLM | 30+ Langues & dialectes | 0.15x - 0.35x RTF | CUDA (vLLM / PyTorch), Metal | Dialectes complexes, milieux bruyants et jargon spécialisé |
| FireRedASR | ASR Industriel | Français, Anglais, Chinois | 0.18x - 0.30x RTF | CUDA, PyTorch | Comptes-rendus d’entreprises et centres d’appels |
Flux standardisé de la réception audio jusqu’à la livraison structurée.
Réception audio via REST/WebSocket, normalisation 16kHz mono et segmentation vocale par Silero-VAD.
Routage vers les instances ASR préchargées en mémoire selon la langue et la latence ciblées.
Accélération GPU avec CUDA TensorRT ou Metal pour émettre des horodatages précis au mot près.
Correction de la ponctuation, filtrage des répétitions et mise en forme en JSON OpenAI, SRT ou VTT.
Intégrez OneASR dans vos systèmes avec quelques lignes de code via des standards ouverts.
from openai import OpenAI
# Initialize client pointing to your local OneASR gateway
client = OpenAI(
base_url="http://localhost:8000/v1",
api_key="sk-oneasr-v1-p_L3kXm9QZ8sT2vA4wE7rY1u"
)
# Transcribe audio file with word-level timestamps
with open("podcast.mp3", "rb") as audio_file:
transcript = client.audio.transcriptions.create(
model="faster-whisper",
file=audio_file,
response_format="verbose_json",
timestamp_granularities=["word", "segment"]
)
print(transcript.text)