Skip to content

Resumen de Motores ASR Soportados ​

OneASR proporciona una arquitectura de motor abstracta (BaseEngine) que estandariza la inicialización de modelos, la inferencia de audio y el formato de salida.


Guía de Selección de Motores ​

mermaid
flowchart TD
    Start[Elegir Motor ASR] --> Q1{¿Necesita Streaming en Tiempo Real?}
    Q1 -- Sí (< 200ms) --> XASR[X-ASR / Zipformer2<br/>Streaming de latencia ultra baja]
    Q1 -- No (Archivos de Audio por Lotes) --> Q2{¿Idioma / Dominio?}
    
    Q2 -- 99+ Idiomas Globales --> FW[Faster-Whisper<br/>El mejor multilingüe general]
    Q2 -- Chino Complejo / Dialectos --> Qwen[Qwen3-ASR<br/>Modelo de voz a gran escala]
    Q2 -- Reuniones en Chino / Empresa --> FR[FireRedASR<br/>Mandarín de alta precisión]

Especificaciones Detalladas ​

  • Motor Faster-Whisper — Implementación CTranslate2 de Whisper altamente optimizada.
  • X-ASR (Zipformer) — Transductor de streaming Sherpa-ONNX con detección de puntos finales por fragmentos.
  • Qwen3-ASR — Modelo de voz de última generación de 1.7B de parámetros con soporte para ForcedAligner.
  • FireRedASR — Motor empresarial de reconocimiento de voz en mandarín e inglés.