Skip to content
Autoalojado · Multi-Motor · Totalmente Compatible con OpenAI

Reconocimiento de Voz UnificadoPasarela API para Sistemas de IA

Despliega infraestructura ASR de nivel industrial en tus propios servidores o Mac en segundos. Agrega Faster-Whisper, Zipformer, Qwen-ASR y FireRedASR con compatibilidad total con la API de Audio de OpenAI.

# 1. Pull and run OneASR with GPU acceleration
$ docker run -d -p 8000:8000 --gpus all codeandxv/oneasr:latest
INFO: Preloading ASR Engines [whisper-medium, xasr-zh-en]...
INFO: Application startup complete. Uvicorn running on http://0.0.0.0:8000
OpenAI API ready at /v1/audio/transcriptions

Diseñado para Alto Rendimiento y Privacidad

Todo lo que necesitas para ejecutar canalizaciones de transcripción de voz privadas y de alto rendimiento.

🔄Reemplazo Directo

Totalmente Compatible con OpenAI

Reemplazo directo para /v1/audio/transcriptions. Conecta sin problemas con Dify, FastGPT, Open WebUI, DuRT y los SDKs oficiales.

⚡Flexible

Agregación Multi-Motor

Enruta dinámicamente peticiones entre Faster-Whisper, Zipformer (X-ASR), Qwen-ASR y FireRedASR mediante configuración YAML simple.

🌊< 200ms

Streaming de Ultra Baja Latencia

Protocolo de audio WebSocket full-duplex para subtítulos en tiempo real, reuniones y agentes de voz conversacionales.

🎯Smart VAD

VAD y Fragmentación Inteligente

Detección de actividad vocal Silero-VAD, segmentación por pausas naturales y supresión automática de alucinaciones.

🖥️UI Integrada

Panel Web con Vue 3

Interfaz interactiva para probar micrófonos, subir audios extensos, monitorizar la GPU y revisar colas de trabajo.

🔒Privacidad Total

100% Privado y Autoalojado

Todos los datos de voz permanecen íntegramente en tu propia infraestructura. Cero telemetría ni fugas a terceros.

Motores ASR Compatibles

Elige el motor idóneo según idioma, latencia y recursos de hardware.

MotorTipoIdiomas SoportadosLatencia / RTFAceleración por HardwareMejor Caso de Uso
Faster-WhisperRecomendado ArchivosTranscripción de Archivos y Lotes99+ Idiomas (Multilingüe)0.12x - 0.25x RTFCUDA, Metal, CPU (int8/fp16)Transcripción de archivos extensos, podcasts y generación de subtítulos
X-ASR (Zipformer2)Menor LatenciaStreaming en Tiempo RealEspañol, Inglés, Chino< 160ms retardo por bloqueCPU, ONNX, Metal, CUDASubtítulos en directo de latencia ultrabaja y asistentes de voz
Qwen3-ASR (1.7B)Reconocimiento Basado en LLM30+ Idiomas y dialectos0.15x - 0.35x RTFCUDA (vLLM / PyTorch), MetalDialectos complejos, ambientes ruidosos y terminología técnica
FireRedASRASR IndustrialEspañol, Inglés, Chino0.18x - 0.30x RTFCUDA, PyTorchActas de reuniones corporativas y centros de llamadas

Arquitectura del Pipeline de OneASR

Flujo estándar desde la ingesta de audio hasta la entrega estructurada.

Step 01

1. Ingesta y Preprocesamiento

Recepción de audio por REST o WebSocket, normalización a 16kHz mono y segmentación inteligente con Silero-VAD.

Step 02

2. Despachador Dinámico

Enrutamiento a instancias precargadas del motor ASR según parámetros de idioma y latencia.

Step 03

3. Inferencia Neuronal y Alineación

Aceleración GPU con CUDA TensorRT o Apple Metal para emitir marcas de tiempo a nivel de palabra.

Step 04

4. Postprocesamiento y Salida Estándar

Normalización de puntuación, filtrado de repeticiones y formato en OpenAI JSON, SRT o VTT.

Experiencia para Desarrolladores

Integra OneASR en tus sistemas con pocas líneas de código mediante estándares abiertos.

from openai import OpenAI

# Initialize client pointing to your local OneASR gateway
client = OpenAI(
    base_url="http://localhost:8000/v1",
    api_key="sk-oneasr-v1-p_L3kXm9QZ8sT2vA4wE7rY1u"
)

# Transcribe audio file with word-level timestamps
with open("podcast.mp3", "rb") as audio_file:
    transcript = client.audio.transcriptions.create(
        model="faster-whisper",
        file=audio_file,
        response_format="verbose_json",
        timestamp_granularities=["word", "segment"]
    )

print(transcript.text)