Despliega infraestructura ASR de nivel industrial en tus propios servidores o Mac en segundos. Agrega Faster-Whisper, Zipformer, Qwen-ASR y FireRedASR con compatibilidad total con la API de Audio de OpenAI.
Todo lo que necesitas para ejecutar canalizaciones de transcripción de voz privadas y de alto rendimiento.
Reemplazo directo para /v1/audio/transcriptions. Conecta sin problemas con Dify, FastGPT, Open WebUI, DuRT y los SDKs oficiales.
Enruta dinámicamente peticiones entre Faster-Whisper, Zipformer (X-ASR), Qwen-ASR y FireRedASR mediante configuración YAML simple.
Protocolo de audio WebSocket full-duplex para subtítulos en tiempo real, reuniones y agentes de voz conversacionales.
Detección de actividad vocal Silero-VAD, segmentación por pausas naturales y supresión automática de alucinaciones.
Interfaz interactiva para probar micrófonos, subir audios extensos, monitorizar la GPU y revisar colas de trabajo.
Todos los datos de voz permanecen íntegramente en tu propia infraestructura. Cero telemetría ni fugas a terceros.
Elige el motor idóneo según idioma, latencia y recursos de hardware.
| Motor | Tipo | Idiomas Soportados | Latencia / RTF | Aceleración por Hardware | Mejor Caso de Uso |
|---|---|---|---|---|---|
| Faster-WhisperRecomendado Archivos | Transcripción de Archivos y Lotes | 99+ Idiomas (Multilingüe) | 0.12x - 0.25x RTF | CUDA, Metal, CPU (int8/fp16) | Transcripción de archivos extensos, podcasts y generación de subtítulos |
| X-ASR (Zipformer2)Menor Latencia | Streaming en Tiempo Real | Español, Inglés, Chino | < 160ms retardo por bloque | CPU, ONNX, Metal, CUDA | Subtítulos en directo de latencia ultrabaja y asistentes de voz |
| Qwen3-ASR (1.7B) | Reconocimiento Basado en LLM | 30+ Idiomas y dialectos | 0.15x - 0.35x RTF | CUDA (vLLM / PyTorch), Metal | Dialectos complejos, ambientes ruidosos y terminología técnica |
| FireRedASR | ASR Industrial | Español, Inglés, Chino | 0.18x - 0.30x RTF | CUDA, PyTorch | Actas de reuniones corporativas y centros de llamadas |
Flujo estándar desde la ingesta de audio hasta la entrega estructurada.
Recepción de audio por REST o WebSocket, normalización a 16kHz mono y segmentación inteligente con Silero-VAD.
Enrutamiento a instancias precargadas del motor ASR según parámetros de idioma y latencia.
Aceleración GPU con CUDA TensorRT o Apple Metal para emitir marcas de tiempo a nivel de palabra.
Normalización de puntuación, filtrado de repeticiones y formato en OpenAI JSON, SRT o VTT.
Integra OneASR en tus sistemas con pocas líneas de código mediante estándares abiertos.
from openai import OpenAI
# Initialize client pointing to your local OneASR gateway
client = OpenAI(
base_url="http://localhost:8000/v1",
api_key="sk-oneasr-v1-p_L3kXm9QZ8sT2vA4wE7rY1u"
)
# Transcribe audio file with word-level timestamps
with open("podcast.mp3", "rb") as audio_file:
transcript = client.audio.transcriptions.create(
model="faster-whisper",
file=audio_file,
response_format="verbose_json",
timestamp_granularities=["word", "segment"]
)
print(transcript.text)