Skip to content
셀프 호스팅 · 멀티 엔진 통합 · OpenAI 완벽 호환

차세대 통합 음성 인식API 게이트웨이 & 사설 인프라

단 몇 초 만에 사설 서버나 Mac에 산업용 ASR 인프라를 구축하세요. Faster-Whisper, Zipformer (X-ASR), Qwen-ASR, FireRedASR을 통합하고 OpenAI Audio API 표준을 완벽 지원합니다.

# 1. Pull and run OneASR with GPU acceleration
$ docker run -d -p 8000:8000 --gpus all codeandxv/oneasr:latest
INFO: Preloading ASR Engines [whisper-medium, xasr-zh-en]...
INFO: Application startup complete. Uvicorn running on http://0.0.0.0:8000
OpenAI API ready at /v1/audio/transcriptions

고처리량, 초저지연 및 개인정보 보호를 위한 설계

개인 생산성 향상부터 엔터프라이즈 사설 음성 파이프라인까지 완벽 대응.

🔄드롭인 호환

OpenAI 규격 완벽 호환

/v1/audio/transcriptions를 그대로 대체. Dify, FastGPT, Open WebUI, DuRT 및 공식 SDK와 즉시 연동.

⚡유연한 전환

멀티 엔진 통합 및 핫 스왑

간결한 YAML 설정을 통해 Faster-Whisper, Zipformer (X-ASR), Qwen-ASR, FireRedASR을 자유롭게 라우팅.

🌊< 200ms 고속

초저지연 WebSocket 스트리밍

실시간 자막, 동시통역, 보이스 에이전트(Voice Agent)에 최적화된 밀리초 단위 양방향 음성 스트림.

🎯스마트 VAD

고성능 VAD 및 스마트 청킹

Silero-VAD 음성 구간 검출을 탑재하여 자연스러운 묵음 끊기, 장시간 음성 분할 및 중복 환각 억제.

🖥️내장 콘솔

Vue 3 웹 대시보드 내장

마이크 녹음 테스트, 대용량 오디오 전사, GPU 상태 모니터링 및 작업 큐 조회가 가능한 깔끔한 UI.

🔒절대적 보안

100% 사설 인프라 & 데이터 통제

모든 음성 데이터는 내부 네트워크 내에만 보관됩니다. 제3자 데이터 전송이나 외부 유출 위험이 없습니다.

지원하는 ASR 엔진 매트릭스

언어 종류, 지연 시간 요구치 및 하드웨어 사양에 맞춰 최적의 엔진을 선택하세요.

엔진명구분지원 언어추론 지연 / RTF하드웨어 가속최적 활용 분야
Faster-Whisper파일 전사 권장파일 및 배치 전사99+개 글로벌 언어 (다국어)0.12x - 0.25x RTFCUDA, Metal, CPU (int8/fp16)다국어 파일 전사, 팟캐스트 자막 생성, 교차 언어 텍스트화
X-ASR (Zipformer2)최저 지연율실시간 스트리밍한국어, 영어, 중국어, 혼합< 160ms 청크 지연CPU, ONNX, Metal, CUDA초저지연 실시간 자막, 회의 동시 텍스트화, 음성 비서
Qwen3-ASR (1.7B)거대 음성인식 모델30+개 언어 및 주요 방언0.15x - 0.35x RTFCUDA (vLLM / PyTorch), Metal복합 방언, 소음 환경 음성 인식, 전문 분야 용어
FireRedASR산업용 범용 ASR한국어, 영어, 중국어0.18x - 0.30x RTFCUDA, PyTorch기업 회의록 작성 및 고객센터 통화 분석

OneASR 파이프라인 아키텍처

오디오 수신, 전처리, 동적 라우팅부터 구조화된 결과 출력까지의 표준 흐름.

Step 01

1. 오디오 수신 및 전처리

REST/WebSocket으로 오디오를 수신하여 16kHz 모노로 정규화하고 Silero-VAD로 발화 구간을 정밀 분할합니다.

Step 02

2. 동적 디스패처

요청의 언어 및 지연 파라미터에 따라 메모리에 사전 로드된 최적의 ASR 엔진으로 라우팅합니다.

Step 03

3. 신경망 추론 및 정렬

CUDA TensorRT 또는 Metal GPU 가속을 통해 밀리초 단위의 단어별 타임스탬프를 생성합니다.

Step 04

4. 후처리 및 표준 출력

구두점 교정 및 중복 제거를 거쳐 OpenAI JSON, SRT, VTT 형식으로 결과를 반환합니다.

개발자 경험 최우선

익숙한 도구와 표준 프로토콜로 몇 줄의 코드만으로 OneASR을 연동하세요.

from openai import OpenAI

# Initialize client pointing to your local OneASR gateway
client = OpenAI(
    base_url="http://localhost:8000/v1",
    api_key="sk-oneasr-v1-p_L3kXm9QZ8sT2vA4wE7rY1u"
)

# Transcribe audio file with word-level timestamps
with open("podcast.mp3", "rb") as audio_file:
    transcript = client.audio.transcriptions.create(
        model="faster-whisper",
        file=audio_file,
        response_format="verbose_json",
        timestamp_granularities=["word", "segment"]
    )

print(transcript.text)