단 몇 초 만에 사설 서버나 Mac에 산업용 ASR 인프라를 구축하세요. Faster-Whisper, Zipformer (X-ASR), Qwen-ASR, FireRedASR을 통합하고 OpenAI Audio API 표준을 완벽 지원합니다.
개인 생산성 향상부터 엔터프라이즈 사설 음성 파이프라인까지 완벽 대응.
/v1/audio/transcriptions를 그대로 대체. Dify, FastGPT, Open WebUI, DuRT 및 공식 SDK와 즉시 연동.
간결한 YAML 설정을 통해 Faster-Whisper, Zipformer (X-ASR), Qwen-ASR, FireRedASR을 자유롭게 라우팅.
실시간 자막, 동시통역, 보이스 에이전트(Voice Agent)에 최적화된 밀리초 단위 양방향 음성 스트림.
Silero-VAD 음성 구간 검출을 탑재하여 자연스러운 묵음 끊기, 장시간 음성 분할 및 중복 환각 억제.
마이크 녹음 테스트, 대용량 오디오 전사, GPU 상태 모니터링 및 작업 큐 조회가 가능한 깔끔한 UI.
모든 음성 데이터는 내부 네트워크 내에만 보관됩니다. 제3자 데이터 전송이나 외부 유출 위험이 없습니다.
언어 종류, 지연 시간 요구치 및 하드웨어 사양에 맞춰 최적의 엔진을 선택하세요.
| 엔진명 | 구분 | 지원 언어 | 추론 지연 / RTF | 하드웨어 가속 | 최적 활용 분야 |
|---|---|---|---|---|---|
| Faster-Whisper파일 전사 권장 | 파일 및 배치 전사 | 99+개 글로벌 언어 (다국어) | 0.12x - 0.25x RTF | CUDA, Metal, CPU (int8/fp16) | 다국어 파일 전사, 팟캐스트 자막 생성, 교차 언어 텍스트화 |
| X-ASR (Zipformer2)최저 지연율 | 실시간 스트리밍 | 한국어, 영어, 중국어, 혼합 | < 160ms 청크 지연 | CPU, ONNX, Metal, CUDA | 초저지연 실시간 자막, 회의 동시 텍스트화, 음성 비서 |
| Qwen3-ASR (1.7B) | 거대 음성인식 모델 | 30+개 언어 및 주요 방언 | 0.15x - 0.35x RTF | CUDA (vLLM / PyTorch), Metal | 복합 방언, 소음 환경 음성 인식, 전문 분야 용어 |
| FireRedASR | 산업용 범용 ASR | 한국어, 영어, 중국어 | 0.18x - 0.30x RTF | CUDA, PyTorch | 기업 회의록 작성 및 고객센터 통화 분석 |
오디오 수신, 전처리, 동적 라우팅부터 구조화된 결과 출력까지의 표준 흐름.
REST/WebSocket으로 오디오를 수신하여 16kHz 모노로 정규화하고 Silero-VAD로 발화 구간을 정밀 분할합니다.
요청의 언어 및 지연 파라미터에 따라 메모리에 사전 로드된 최적의 ASR 엔진으로 라우팅합니다.
CUDA TensorRT 또는 Metal GPU 가속을 통해 밀리초 단위의 단어별 타임스탬프를 생성합니다.
구두점 교정 및 중복 제거를 거쳐 OpenAI JSON, SRT, VTT 형식으로 결과를 반환합니다.
익숙한 도구와 표준 프로토콜로 몇 줄의 코드만으로 OneASR을 연동하세요.
from openai import OpenAI
# Initialize client pointing to your local OneASR gateway
client = OpenAI(
base_url="http://localhost:8000/v1",
api_key="sk-oneasr-v1-p_L3kXm9QZ8sT2vA4wE7rY1u"
)
# Transcribe audio file with word-level timestamps
with open("podcast.mp3", "rb") as audio_file:
transcript = client.audio.transcriptions.create(
model="faster-whisper",
file=audio_file,
response_format="verbose_json",
timestamp_granularities=["word", "segment"]
)
print(transcript.text)