Resumen de Motores ASR Soportados
OneASR proporciona una arquitectura de motor abstracta (BaseEngine) que estandariza la inicialización de modelos, la inferencia de audio y el formato de salida.
Guía de Selección de Motores
mermaid
flowchart TD
Start[Elegir Motor ASR] --> Q1{¿Necesita Streaming en Tiempo Real?}
Q1 -- Sí (< 200ms) --> XASR[X-ASR / Zipformer2<br/>Streaming de latencia ultra baja]
Q1 -- No (Archivos de Audio por Lotes) --> Q2{¿Idioma / Dominio?}
Q2 -- 99+ Idiomas Globales --> FW[Faster-Whisper<br/>El mejor multilingüe general]
Q2 -- Chino Complejo / Dialectos --> Qwen[Qwen3-ASR<br/>Modelo de voz a gran escala]
Q2 -- Reuniones en Chino / Empresa --> FR[FireRedASR<br/>Mandarín de alta precisión]Especificaciones Detalladas
- Motor Faster-Whisper — Implementación CTranslate2 de Whisper altamente optimizada.
- X-ASR (Zipformer) — Transductor de streaming Sherpa-ONNX con detección de puntos finales por fragmentos.
- Qwen3-ASR — Modelo de voz de última generación de 1.7B de parámetros con soporte para ForcedAligner.
- FireRedASR — Motor empresarial de reconocimiento de voz en mandarín e inglés.
