Vue d’Ensemble & Architecture de OneASR
OneASR est une passerelle d’agrégation de reconnaissance vocale (ASR) open source à haut débit et un serveur d’inférence auto-hébergé. Il standardise divers modèles vocaux en API unifiées et compatibles OpenAI ainsi qu’en flux WebSocket à latence ultra-faible.
Pourquoi OneASR ?
Les applications d’IA modernes et les agents vocaux nécessitent une reconnaissance vocale fiable, privée et à faible latence. Cependant, l’exécution de modèles ASR de pointe introduit souvent des interfaces fragmentées, l’absence de pipelines VAD/découpage et des coûts de cloud élevés.
OneASR répond à ces défis en offrant :
- Compatibilité Unifiée OpenAI : Remplacement direct pour
POST /v1/audio/transcriptions. - Multiplexage Multi-Moteurs : Basculez entre Faster-Whisper, X-ASR (Zipformer), Qwen3-ASR et FireRedASR sans modifier le code client.
- VAD et Découpage Intégrés : Le pipeline Silero-VAD gère automatiquement la normalisation audio, la segmentation des silences et le filtrage des répétitions.
- 100 % Souveraineté des Données : Auto-hébergé sur votre Mac, station de travail GPU locale ou cluster Kubernetes, sans aucune télémétrie externe.
Architecture du Système
[ Clients & Applications IA ] (DuRT, Dify, Open WebUI, SDK Python, cURL)
│
▼ (HTTP / WebSocket)
┌────────────────────────────────────────────────────────┐
│ Passerelle OneASR (FastAPI) │
│ │
│ ┌───────────────────────┐ ┌───────────────────────┐ │
│ │ Authentification & API│ │ ASR-Toolkit (VAD) │ │
│ │ • /v1/audio/* │ │ • Silero-VAD │ │
│ │ • /api/v1/stream │ │ • Découpage Dynamique│ │
│ └───────────┬───────────┘ └───────────┬───────────┘ │
│ │ │ │
│ ▼ ▼ │
│ ┌──────────────────────────────────────────────────┐ │
│ │ Registre & Répartiteur de Moteurs │ │
│ └──────────────────────────┬───────────────────────┘ │
└─────────────────────────────┼──────────────────────────┘
│
┌────────────────────┼────────────────────┐
▼ ▼ ▼
┌──────────────────┐ ┌──────────────────┐ ┌──────────────────┐
│ Faster-Whisper │ │ X-ASR Zipformer │ │ Qwen3-ASR │
│ (CUDA/Metal/CPU) │ │ (ONNX / Stream) │ │ (vLLM / PyTorch) │
└──────────────────┘ └──────────────────┘ └──────────────────┘Fonctionnalités Clés
- Streaming Temps Réel : Traitement par paquets de moins de 200 ms via le protocole duplex intégral WebSocket.
- Traitements par Lots Asynchrones : Téléversement de fichiers audio/vidéo volumineux de plusieurs gigaoctets avec exécution en arrière-plan et interrogation d’état.
- Horodatages à la Milliseconde : Génération d’horodatages au niveau du mot et de la phrase pour la synchronisation de sous-titres et la diarisation.
- Console Web Intégrée : Tableau de bord interactif Vue 3 pour tester le microphone, consulter les métriques des modèles et gérer les tâches.
Prochaines Étapes
- Guide de Déploiement Docker — Le moyen le plus rapide de lancer OneASR avec support GPU NVIDIA.
- Installation Manuelle — Installer via un environnement virtuel Python sur macOS ou Linux.
- Accélération Matérielle — Ajuster CUDA, Metal pour Apple Silicon et l’allocation des threads CPU.
