Visión General y Arquitectura de OneASR
OneASR es una pasarela de agregación de reconocimiento de voz (ASR) de código abierto y alto rendimiento, además de un servidor de inferencia autoalojado. Estandariza diversos modelos de voz en APIs unificadas y compatibles con OpenAI, así como en transmisiones WebSocket de latencia ultra baja.
¿Por qué OneASR?
Las aplicaciones de IA modernas y los agentes de voz requieren un reconocimiento de voz fiable, privado y de baja latencia. Sin embargo, ejecutar modelos ASR punteros a menudo introduce interfaces fragmentadas, ausencia de canalizaciones de VAD/segmentación y altos costes en la nube.
OneASR resuelve esto proporcionando:
- Compatibilidad Unificada con OpenAI: Reemplazo directo para
POST /v1/audio/transcriptions. - Multiplexación Multi-Motor: Alterne entre Faster-Whisper, X-ASR (Zipformer), Qwen3-ASR y FireRedASR sin modificar el código del cliente.
- VAD y Segmentación Integrados: El flujo de Silero-VAD gestiona automáticamente la normalización de audio, la segmentación por pausas y el filtrado de repeticiones.
- 100% Soberanía de Datos: Autoalojado en su Mac, estación de trabajo con GPU local o clúster Kubernetes con cero telemetría externa.
Arquitectura del Sistema
[ Clientes y Apps de IA ] (DuRT, Dify, Open WebUI, SDK de Python, cURL)
│
▼ (HTTP / WebSocket)
┌────────────────────────────────────────────────────────┐
│ Pasarela OneASR (FastAPI) │
│ │
│ ┌───────────────────────┐ ┌───────────────────────┐ │
│ │ Autenticación y API │ │ ASR-Toolkit (VAD) │ │
│ │ • /v1/audio/* │ │ • Silero-VAD │ │
│ │ • /api/v1/stream │ │ • Segmentación Dinám.│ │
│ └───────────┬───────────┘ └───────────┬───────────┘ │
│ │ │ │
│ ▼ ▼ │
│ ┌──────────────────────────────────────────────────┐ │
│ │ Registro y Despachador de Motores │ │
│ └──────────────────────────┬───────────────────────┘ │
└─────────────────────────────┼──────────────────────────┘
│
┌────────────────────┼────────────────────┐
▼ ▼ ▼
┌──────────────────┐ ┌──────────────────┐ ┌──────────────────┐
│ Faster-Whisper │ │ X-ASR Zipformer │ │ Qwen3-ASR │
│ (CUDA/Metal/CPU) │ │ (ONNX / Stream) │ │ (vLLM / PyTorch) │
└──────────────────┘ └──────────────────┘ └──────────────────┘Capacidades Principales
- Streaming en Tiempo Real: Procesamiento de fragmentos en menos de 200 ms con protocolo dúplex completo WebSocket.
- Tareas Asíncronas por Lotes: Suba archivos de audio/vídeo de varios gigabytes con ejecución en segundo plano y sondeo de estado.
- Marcas de Tiempo en Milisegundos: Generación de marcas de tiempo a nivel de palabra y frase para sincronización de subtítulos y diarización.
- Consola Web Integrada: Panel interactivo Vue 3 para pruebas de micrófono, métricas de modelos y gestión de tareas.
Siguientes Pasos
- Guía de Despliegue con Docker — La forma más rápida de iniciar OneASR con soporte para GPU NVIDIA.
- Instalación Manual — Instalar mediante entorno virtual Python en macOS o Linux.
- Aceleración por Hardware — Optimizar CUDA, Metal en Apple Silicon y asignación de hilos de CPU.
