Skip to content

Visión General y Arquitectura de OneASR ​

OneASR es una pasarela de agregación de reconocimiento de voz (ASR) de código abierto y alto rendimiento, además de un servidor de inferencia autoalojado. Estandariza diversos modelos de voz en APIs unificadas y compatibles con OpenAI, así como en transmisiones WebSocket de latencia ultra baja.


¿Por qué OneASR? ​

Las aplicaciones de IA modernas y los agentes de voz requieren un reconocimiento de voz fiable, privado y de baja latencia. Sin embargo, ejecutar modelos ASR punteros a menudo introduce interfaces fragmentadas, ausencia de canalizaciones de VAD/segmentación y altos costes en la nube.

OneASR resuelve esto proporcionando:

  1. Compatibilidad Unificada con OpenAI: Reemplazo directo para POST /v1/audio/transcriptions.
  2. Multiplexación Multi-Motor: Alterne entre Faster-Whisper, X-ASR (Zipformer), Qwen3-ASR y FireRedASR sin modificar el código del cliente.
  3. VAD y Segmentación Integrados: El flujo de Silero-VAD gestiona automáticamente la normalización de audio, la segmentación por pausas y el filtrado de repeticiones.
  4. 100% Soberanía de Datos: Autoalojado en su Mac, estación de trabajo con GPU local o clúster Kubernetes con cero telemetría externa.

Arquitectura del Sistema ​

[ Clientes y Apps de IA ] (DuRT, Dify, Open WebUI, SDK de Python, cURL)
        │
        ▼ (HTTP / WebSocket)
┌────────────────────────────────────────────────────────┐
│               Pasarela OneASR (FastAPI)                │
│                                                        │
│  ┌───────────────────────┐  ┌───────────────────────┐  │
│  │  Autenticación y API  │  │   ASR-Toolkit (VAD)   │  │
│  │  • /v1/audio/*        │  │  • Silero-VAD         │  │
│  │  • /api/v1/stream     │  │  • Segmentación Dinám.│  │
│  └───────────┬───────────┘  └───────────┬───────────┘  │
│              │                          │              │
│              ▼                          ▼              │
│  ┌──────────────────────────────────────────────────┐  │
│  │        Registro y Despachador de Motores         │  │
│  └──────────────────────────┬───────────────────────┘  │
└─────────────────────────────┼──────────────────────────┘
                              │
         ┌────────────────────┼────────────────────┐
         ▼                    ▼                    ▼
┌──────────────────┐ ┌──────────────────┐ ┌──────────────────┐
│  Faster-Whisper  │ │  X-ASR Zipformer │ │    Qwen3-ASR     │
│ (CUDA/Metal/CPU) │ │ (ONNX / Stream)  │ │ (vLLM / PyTorch) │
└──────────────────┘ └──────────────────┘ └──────────────────┘

Capacidades Principales ​

  • Streaming en Tiempo Real: Procesamiento de fragmentos en menos de 200 ms con protocolo dúplex completo WebSocket.
  • Tareas Asíncronas por Lotes: Suba archivos de audio/vídeo de varios gigabytes con ejecución en segundo plano y sondeo de estado.
  • Marcas de Tiempo en Milisegundos: Generación de marcas de tiempo a nivel de palabra y frase para sincronización de subtítulos y diarización.
  • Consola Web Integrada: Panel interactivo Vue 3 para pruebas de micrófono, métricas de modelos y gestión de tareas.

Siguientes Pasos ​