클라우드 기반의 상용 음성 합성(TTS) 및 보이스 클로닝 서비스들이 고가의 구독료와 다운로드 분량 제한 정책을 유지하고 있는 가운데, 오픈소스 음성 생성 AI 생태계에 중대한 아키텍처 전환을 알리는 모델이 공개되었습니다.

청화대(Tsinghua) OpenBMB 연구팀이 선보인 VoxCPM2(OpenBMB/VoxCPM)는 기존 TTS 모델들의 치명적 약점이었던 토크나이저(Tokenizer) 의존성을 완전히 제거하고, 2B 파라미터 기반으로 48kHz 스튜디오 레코딩 음질을 구현한 오픈소스 다국어 음성 생성 파운데이션 모델입니다.

Sources

1. 전통적 TTS의 한계와 “Tokenizer-Free” 아키텍처

기존의 대다수 신경망 TTS 모델은 연속적인 오디오 파형을 이산적(Discrete) 토큰으로 양자화(Quantization)한 뒤 생성하는 방식을 취했습니다. 이 과정에서 필연적인 오디오 정보 손실이 발생하여, 음색의 질감이 거칠어지거나 인간 특유의 자연스러운 숨소리와 호흡 리듬이 끊기는 현상이 발생했습니다.

VoxCPM2는 **토크나이저를 완전히 배제(Tokenizer-Free)**하고, **연속 잠재 공간(Continuous Latent Space) 상에서 확산 자기회귀(Diffusion Autoregression)**를 직접 수행합니다. 이로 인해 음색, 감정 뉘앙스, 말속도, 미세한 날숨과 들숨의 리듬까지 엔드투엔드로 완벽히 보존합니다.

2. 주요 성능 지표 및 하드웨어 효율성

  • 200만 시간 이상의 다국어 데이터셋: 20억 개(2B) 파라미터 기반으로 200만 시간 이상의 방대한 음성 코퍼스로 사전 학습되어 스튜디오급 48kHz 고해상도 오디오를 직접 출력합니다.
  • 초저지연 실시간 스트리밍: NVIDIA RTX 4090 기준 RTF(Real-Time Factor) 0.13을 기록하여, 대화형 AI 에이전트와 결합해도 버벅임 없는 즉각적인 음성 스트리밍 출력을 지원합니다.
  • 30개 언어 및 9개 방언 지원: 표준 다국어뿐만 아니라 보통화, 광둥어, 민남어 등 다양한 방언 간의 유연한 전환을 지원합니다.

3. 혁신적인 보이스 생성 및 클로닝 기능

1) 무참조 텍스트 프롬프트 기반 음성 생성 (Zero-Shot Prompting)

사전 녹음된 참조 오디오 파일 없이도, *“30대 중반의 차분하고 신뢰감 있는 오디오북 나레이터”*처럼 자연어 묘사 텍스트만으로 새로운 목소리를 무에서 유로 즉석 설계할 수 있습니다.

2) 호흡과 말버릇까지 복제하는 초정밀 클로닝

짧은 레퍼런스 음성 클립만 주어지면 대상 화자의 고유한 억양뿐만 아니라 감정 상태, 말속도, 심지어 특정 말버릇(말더듬, 쉼표 타이밍)까지 완벽하게 복제해 냅니다.

4. 라이선스 및 실무 도입 가치

  • Apache-2.0 라이선스: 제약 없는 완전 오픈소스로 공개되어 팟캐스트, 오디오북, 게임 캐릭터 음성, 유튜브 나레이션 등 상업적 제품 개발에 무료로 자유롭게 도입할 수 있습니다.
  • GitHub 공개 직후 10,000개 이상의 Star를 획득하며 글로벌 AI 음성 모델의 새로운 표준으로 자리매김하고 있습니다.