Skip to content

OneASR 프로젝트 개요 및 핵심 아키텍처 ​

OneASR은 오픈소스 기반의 고처리량, 초저지연 음성 인식(ASR) 통합 게이트웨이이자 셀프 호스팅 추론 서비스 프레임워크입니다. 최신 음성인식 모델들을 표준화하여 일원화된 OpenAI Audio API 규격 및 밀리초 단위 전이중(Full-Duplex) WebSocket 스트리밍 인터페이스로 제공합니다.


왜 OneASR이 필요한가요? ​

현대 AI 애플리케이션 및 음성 대화 에이전트(Voice Agent) 개발 시, 자체 음성 인식 환경을 구축할 때 파편화된 인터페이스, 표준 VAD 세분화 모듈의 부재, 복잡한 모델 스케줄링, 상용 클라우드 API의 높은 비용 등의 문제에 직면하게 됩니다.

OneASR은 이러한 과제를 해결하기 위해 설계되었습니다:

  1. OpenAI 규격 완벽 호환: 코드 수정 없이 POST /v1/audio/transcriptions 엔드포인트를 그대로 대체할 수 있습니다.
  2. 다중 엔진 동적 통합: 단 한 줄의 설정으로 Faster-Whisper, X-ASR (Zipformer), Qwen3-ASR, FireRedASR을 즉시 전환하여 사용할 수 있습니다.
  3. 네이티브 VAD 및 스마트 문장 분할: Silero-VAD 음성 활동 감지를 내장하여 묵음 구간 자동 분할, 대용량 파일 청킹 및 반복 환각(Hallucination) 필터링을 지원합니다.
  4. 100% 데이터 프라이버시 및 자체 제어: 로컬 Mac, 프라이빗 GPU 서버 또는 Kubernetes 클러스터에 배포하여 외부 데이터 유출을 원천 차단합니다.

시스템 아키텍처 다이어그램 ​

[ 클라이언트 & 타사 AI 시스템 ] (DuRT, Dify, Open WebUI, Python SDK, cURL)
        │
        ▼ (HTTP REST / WebSocket)
┌────────────────────────────────────────────────────────┐
│                   OneASR Gateway (FastAPI)             │
│                                                        │
│  ┌───────────────────────┐  ┌───────────────────────┐  │
│  │   인증 및 API 라우팅 계층 │  │  ASR-Toolkit (VAD)    │  │
│  │  • /v1/audio/*        │  │  • Silero-VAD 음성 감지  │  │
│  │  • /api/v1/stream     │  │  • 동적 청크 슬라이싱   │  │
│  └───────────┬───────────┘  └───────────┬───────────┘  │
│              │                          │              │
│              ▼                          ▼              │
│  ┌──────────────────────────────────────────────────┐  │
│  │            엔진 레지스트리 및 요청 디스패처          │  │
│  └──────────────────────────┬───────────────────────┘  │
└─────────────────────────────┼──────────────────────────┘
                              │
         ┌────────────────────┼────────────────────┐
         ▼                    ▼                    ▼
┌──────────────────┐ ┌──────────────────┐ ┌──────────────────┐
│  Faster-Whisper  │ │  X-ASR Zipformer │ │    Qwen3-ASR     │
│  (다국어 배치 처리) │ │ (초저지연 실시간)  │ │ (LLM 기반 고정밀) │
└──────────────────┘ └──────────────────┘ └──────────────────┘

핵심 기능 ​

  • 초저지연 실시간 스트리밍: Zipformer2 Transducer 구조를 바탕으로 160ms 청크 단위 실시간 스트리밍 인식을 지원합니다.
  • 비동기 배치 작업 큐: 수 GB 단위의 대용량 오디오/비디오 파일을 업로드하고 백그라운드 멀티 워커를 통해 비동기 전사 및 진행률 조회가 가능합니다.
  • 단어 단위 밀리초 타임스탬프: 정밀한 자막(SRT/VTT) 생성을 지원하여 동영상 제작자 및 회의록 작성에 정확한 타임라인을 제공합니다.
  • 내장 Vue 3 시각화 대시보드: 즉시 사용 가능한 웹 대시보드를 통해 브라우저 마이크 테스트, 엔진 벤치마크, 큐 관리를 손쉽게 수행할 수 있습니다.

빠른 가이드 탐색 ​