ElevenLabs 대체! MS가 공개 후 철수한 무료 AI 음성 모델 Vibe Voice 로컬 설치 및 목소리 복제 가이드
ElevenLabs 대체! MS가 공개 후 철수한 무료 AI 음성 모델 Vibe Voice 로컬 설치 및 목소리 복제 가이드
유료 구독 없이 내 컴퓨터에서 무제한으로 고품질 AI 음성과 팟캐스트를 생성하는 방법
월 구독료 부담이 큰 ElevenLabs나 목소리 커스텀이 불가능한 NotebookLM 대신, 로컬 컴퓨터에서 완벽하게 무료로 구동할 수 있는 최강의 AI 음성 생성 모델 Vibe Voice를 소개합니다.
💡 Vibe Voice란?
마이크로소프트(Microsoft)에서 개발한 자가회귀(Auto-regressive) 언어 모델 기반 확산(Diffusion) 음성 합성 모델입니다. 진짜 사람 같은 억양, 호흡, 자연스러운 억양을 구현하여 딥페이크 남용 우려로 공식 버전에서는 TTS 기능이 제거되었으나, 커뮤니티 보존 버전을 통해 전체 기능을 로컬에서 그대로 이용할 수 있습니다.
✨ Vibe Voice 핵심 기능
- ✔무제한 무료 & 개인정보 보호: 외부 서버 전송 없이 로컬 GPU/CPU 기반 실행
- ✔30초 단기 음성 복제(Voice Cloning): 짧은 녹음 파일만으로 내 목소리 커스텀 복제 가능
- ✔다중 화자 대화(Multi-Speaker Podcast): 최대 4명 이상의 화자가 자연스럽게 주고받는 AI 대화 생성
- ✔다국어 지원: 한국어, 영어, 중국어 등 한 문장 안에서 교차 언어 자연스럽게 처리
🛠️ 상세 설치 방법 (Step-by-Step)
공식 MS 저장소는 TTS 기능이 제거되었으므로, **전체 기능이 살아있는 커뮤니티 저장소(Repository)**를 클론해야 합니다. Claude Code 또는 터미널을 이용하면 터미널 명령 한 줄로 설치 가능합니다.
STEP 1. 저장소 클론 및 기본 환경 구축
터미널(Terminal) 또는 Claude Code CLI를 열고 아래 명령어를 실행합니다.
git clone https://github.com/community-vibe-voice/vibe-voice-full.git cd vibe-voice-full pip install -r requirements.txt
STEP 2. AI 모델 웨이트 다운로드 (1.5B vs 7B)
시스템 사양에 맞춰 모델 크기를 선택합니다.
- 1.5B 모델: 일반 그래픽카드(VRAM 8GB 이상) 권장, 빠른 생성 속도
- 7B 모델: 고성능 GPU(VRAM 16GB 이상) 권장, 최상급 음질 및 고정밀 억양
# 1.5B 모델 다운로드 (기본 추천) python download_model.py --model_size 1.5B # 7B 모델 다운로드 (고성능) # python download_model.py --model_size 7B
STEP 3. 웹 UI 서버 실행 및 테스트
로컬 서버를 띄워 브라우저 웹 인터페이스에서 편리하게 조작할 수 있습니다.
python app.py
실행 완료 후 터미널에 출력되는 http://localhost:7860 주소를 크롬 브라우저에 입력해 접속합니다.
🎙️ 내 목소리 30초 만에 복제하는 방법
- 스마트폰 음성 메모 앱을 켜고 잡음 없는 조용한 방에서 약 30초 동안 자연스럽게 말하며 녹음합니다.
- 녹음 파일을 PC로 전송합니다. (Mac의 경우
.m4a확장자로 저장될 수 있으므로.wav확장자로 변환 필요) - 변환된
my_voice.wav파일을 프로젝트 내부의/custom_voices/폴더로 이동합니다. - 서버를 재시작(
python app.py)하면 웹 UI 스피커 목록에 내 이름의 음성 옵션이 새롭게 추가됩니다.
💡 실전 활용 아이디어
🎧 팟캐스트 자동 제작
대본만 입력하면 2~4명의 화자가 티키타카를 주고받는 대화형 팟캐스트 완성
📝 블로그 오디오 북
작성한 텍스트 포스팅을 내 목소리로 읽어주는 고음질 오디오 콘텐츠 변환
🎬 유튜브 쇼츠 더빙
감정과 억양이 살아있는 목소리로 나레이션 영상 제작 비용 절감
댓글
댓글 쓰기