Skip to content

Vue d’Ensemble & Architecture de OneASR ​

OneASR est une passerelle d’agrégation de reconnaissance vocale (ASR) open source à haut débit et un serveur d’inférence auto-hébergé. Il standardise divers modèles vocaux en API unifiées et compatibles OpenAI ainsi qu’en flux WebSocket à latence ultra-faible.


Pourquoi OneASR ? ​

Les applications d’IA modernes et les agents vocaux nécessitent une reconnaissance vocale fiable, privée et à faible latence. Cependant, l’exécution de modèles ASR de pointe introduit souvent des interfaces fragmentées, l’absence de pipelines VAD/découpage et des coûts de cloud élevés.

OneASR répond à ces défis en offrant :

  1. Compatibilité Unifiée OpenAI : Remplacement direct pour POST /v1/audio/transcriptions.
  2. Multiplexage Multi-Moteurs : Basculez entre Faster-Whisper, X-ASR (Zipformer), Qwen3-ASR et FireRedASR sans modifier le code client.
  3. VAD et Découpage Intégrés : Le pipeline Silero-VAD gère automatiquement la normalisation audio, la segmentation des silences et le filtrage des répétitions.
  4. 100 % Souveraineté des Données : Auto-hébergé sur votre Mac, station de travail GPU locale ou cluster Kubernetes, sans aucune télémétrie externe.

Architecture du Système ​

[ Clients & Applications IA ] (DuRT, Dify, Open WebUI, SDK Python, cURL)
        │
        ▼ (HTTP / WebSocket)
┌────────────────────────────────────────────────────────┐
│               Passerelle OneASR (FastAPI)              │
│                                                        │
│  ┌───────────────────────┐  ┌───────────────────────┐  │
│  │ Authentification & API│  │   ASR-Toolkit (VAD)   │  │
│  │  • /v1/audio/*        │  │  • Silero-VAD         │  │
│  │  • /api/v1/stream     │  │  • Découpage Dynamique│  │
│  └───────────┬───────────┘  └───────────┬───────────┘  │
│              │                          │              │
│              ▼                          ▼              │
│  ┌──────────────────────────────────────────────────┐  │
│  │       Registre & Répartiteur de Moteurs          │  │
│  └──────────────────────────┬───────────────────────┘  │
└─────────────────────────────┼──────────────────────────┘
                              │
         ┌────────────────────┼────────────────────┐
         ▼                    ▼                    ▼
┌──────────────────┐ ┌──────────────────┐ ┌──────────────────┐
│  Faster-Whisper  │ │  X-ASR Zipformer │ │    Qwen3-ASR     │
│ (CUDA/Metal/CPU) │ │ (ONNX / Stream)  │ │ (vLLM / PyTorch) │
└──────────────────┘ └──────────────────┘ └──────────────────┘

Fonctionnalités Clés ​

  • Streaming Temps Réel : Traitement par paquets de moins de 200 ms via le protocole duplex intégral WebSocket.
  • Traitements par Lots Asynchrones : Téléversement de fichiers audio/vidéo volumineux de plusieurs gigaoctets avec exécution en arrière-plan et interrogation d’état.
  • Horodatages à la Milliseconde : Génération d’horodatages au niveau du mot et de la phrase pour la synchronisation de sous-titres et la diarisation.
  • Console Web Intégrée : Tableau de bord interactif Vue 3 pour tester le microphone, consulter les métriques des modèles et gérer les tâches.

Prochaines Étapes ​