Skip to content
Auto-Hébergé · Multi-Moteurs · Compatible OpenAI

Passerelle Vocale UnifiéeAPI Dédiée aux Systèmes d’IA

Déployez une infrastructure ASR de niveau industriel sur vos serveurs ou votre Mac en quelques secondes. Agrégez Faster-Whisper, Zipformer, Qwen-ASR et FireRedASR avec une compatibilité totale avec l’API OpenAI Audio.

# 1. Pull and run OneASR with GPU acceleration
$ docker run -d -p 8000:8000 --gpus all codeandxv/oneasr:latest
INFO: Preloading ASR Engines [whisper-medium, xasr-zh-en]...
INFO: Application startup complete. Uvicorn running on http://0.0.0.0:8000
OpenAI API ready at /v1/audio/transcriptions

Conçu pour la Performance et la Confidentialité

Tout ce dont vous avez besoin pour vos flux de transcription vocale privés et à haut débit.

🔄Drop-in

Compatibilité Totale OpenAI

Remplacement direct pour /v1/audio/transcriptions. Connexion transparente avec Dify, FastGPT, Open WebUI, DuRT et les SDKs officiels.

⚡Flexible

Agrégation Multi-Moteurs

Acheminement dynamique vers Faster-Whisper, Zipformer (X-ASR), Qwen-ASR et FireRedASR via une configuration YAML claire.

🌊< 200ms

Streaming à Ultra-Faible Latence

Protocole audio WebSocket duplex intégral pour sous-titrage en temps réel, réunions et agents vocaux interactifs.

🎯Smart VAD

VAD et Découpage Intelligent

Détection d’activité vocale Silero-VAD, découpage basé sur les pauses naturelles et suppression des hallucinations.

🖥️UI Intégrée

Tableau de Bord Vue 3 Intégré

Interface web pour tester le micro, téléverser de longs fichiers, surveiller le GPU et suivre les tâches.

🔒Confidentialité Totale

100% Privé et Auto-Hébergé

Toutes les données audio restent au sein de votre infrastructure. Zéro télémétrie ni fuite de données vers des tiers.

Moteurs ASR Pris en Charge

Sélectionnez le meilleur moteur en fonction de la langue, de la latence et de votre matériel.

MoteurTypeLangues SupportéesLatence / RTFAccélération MatérielleCas d’Usage Idéal
Faster-WhisperRecommandé FichiersTranscription de Fichiers & Lots99+ Langues (Multilingue)0.12x - 0.25x RTFCUDA, Metal, CPU (int8/fp16)Transcription de fichiers longs, podcasts et sous-titrage automatisé
X-ASR (Zipformer2)Latence MinimaleStreaming Temps RéelFrançais, Anglais, Chinois< 160ms délai par blocCPU, ONNX, Metal, CUDASous-titrage direct à latence minimale et assistants vocaux
Qwen3-ASR (1.7B)Reconnaissance Basée sur LLM30+ Langues & dialectes0.15x - 0.35x RTFCUDA (vLLM / PyTorch), MetalDialectes complexes, milieux bruyants et jargon spécialisé
FireRedASRASR IndustrielFrançais, Anglais, Chinois0.18x - 0.30x RTFCUDA, PyTorchComptes-rendus d’entreprises et centres d’appels

Architecture du Pipeline OneASR

Flux standardisé de la réception audio jusqu’à la livraison structurée.

Step 01

1. Réception et Prétraitement

Réception audio via REST/WebSocket, normalisation 16kHz mono et segmentation vocale par Silero-VAD.

Step 02

2. Répartiteur Dynamique

Routage vers les instances ASR préchargées en mémoire selon la langue et la latence ciblées.

Step 03

3. Inférence Neuronale & Alignement

Accélération GPU avec CUDA TensorRT ou Metal pour émettre des horodatages précis au mot près.

Step 04

4. Post-traitement et Sortie Standard

Correction de la ponctuation, filtrage des répétitions et mise en forme en JSON OpenAI, SRT ou VTT.

Expérience Développeur Optimale

Intégrez OneASR dans vos systèmes avec quelques lignes de code via des standards ouverts.

from openai import OpenAI

# Initialize client pointing to your local OneASR gateway
client = OpenAI(
    base_url="http://localhost:8000/v1",
    api_key="sk-oneasr-v1-p_L3kXm9QZ8sT2vA4wE7rY1u"
)

# Transcribe audio file with word-level timestamps
with open("podcast.mp3", "rb") as audio_file:
    transcript = client.audio.transcriptions.create(
        model="faster-whisper",
        file=audio_file,
        response_format="verbose_json",
        timestamp_granularities=["word", "segment"]
    )

print(transcript.text)