로컬 TTS 통합 패키지: MioTTS + Qwen3-TTS 한 폴더에서 동시 운용하기

"MioTTS와 Qwen3-TTS 두 로컬 음성합성 WebUI를 한 폴더에서 포트를 분리해 동시에 돌리는 방법. 언어 지원·보이스 클론·design 모드·설치·문제 해결까지 한 번에 정리."

로컬 TTS 통합 패키지: MioTTS + Qwen3-TTS 한 폴더에서 동시 운용하기

로컬에서 돌아가는 음성합성(TTS) 도구를 찾다 보면 결국 "언어별로 강점이 다르다"는 벽에 부딪힙니다. 이 패키지는 그 문제를 두 엔진을 한 폴더에 묶는 방식으로 풀었습니다. MioTTS와 Qwen3-TTS 두 가지 로컬 TTS WebUI를 하나의 폴더에서 운용하며, 포트가 분리되어 있어 동시에 실행할 수 있습니다. 앱별 상세 설명은 각각폴더 안에 README.md 에 정리되어 있습니다.

GitHub - flutterkage2k/qwen3tts_miotts_custom: 로컬 TTS 통합 패키지 — MioTTS(영어·일본어) + Qwen3-TTS(한국어 포함 10개 언어). 보이스 클론, 멀티화자 대화, 자연어 목소리 창조(design 모드), bat 더블클릭 설치 지원
로컬 TTS 통합 패키지 — MioTTS(영어·일본어) + Qwen3-TTS(한국어 포함 10개 언어). 보이스 클론, 멀티화자 대화, 자연어 목소리 창조(design 모드), bat 더블클릭 설치 지원 - flutterkage2k/qwen3tts_miotts_custom

한눈 비교

두 앱은 지향점이 다릅니다. 표로 먼저 정리합니다.

항목 🎙️ MioTTS 로컬판 🎙️ Qwen3-TTS 로컬판
지원 언어 영어, 일본어 (2개) 한국어 포함 10개 (중·영·일·한·독·프·러·포·스·이)
엔진 MioTTS-Inference + Ollama(GGUF) qwen-tts 공식 패키지 (모델 직접 로드)
모델 크기 0.1B~2.6B (기본 1.7B) 0.6B / 1.7B (기본 1.7B)
포트 7860 clone·custom 7861 / design 7862
보이스 클론 참조 음성(약 20초 이내 권장) 참조 음성 3초 이상 + 참조 대사(권장)
특수 기능 design 모드: 자연어 설명으로 목소리 창조 + 설명 조합기
내장 화자 기본 프리셋 4종 (jp/en 남녀, 상업적 이용 금지) custom 모드 내장 화자 9종 (한국어 Sohee 포함)
플랫폼 Windows(NVIDIA) / macOS(Apple Silicon) Windows(NVIDIA)

어떤 앱을 쓸까요. 한국어 음성이 필요하면 Qwen3-TTS입니다. 일본어·영어 전용 작업이면서 기존 MioTTS 프리셋을 쓰던 워크플로라면 MioTTS가 맞습니다. 목소리를 새로 "창조"하고 싶다면 Qwen의 design 모드를 검토해 볼 수 있습니다.

이럴 때 쓰면 좋습니다

지원 언어와 기능을 기준으로 정리하면, 다음과 같은 상황에서 이 패키지의 각 모드가 유용합니다.

  • 한 프로젝트에서 여러 언어가 필요할 때 — 한국어는 Qwen3-TTS, 일본어·영어는 MioTTS로 분담해 한 폴더에서 처리할 수 있습니다.
  • 여러 화자의 대화 음성이 필요할 때 — 두 앱 모두 지원하는 🎭 멀티화자 대본 문법으로 화자별 대사를 한 번에 합성할 수 있습니다.
  • 새로운 목소리를 직접 설계하고 싶을 때 — Qwen design 모드에서 자연어 설명으로 목소리를 만든 뒤 프리셋으로 저장해 재사용할 수 있습니다.
참고: 위 활용은 README에 명시된 기능 범위 내 예시입니다. 실제 결과물 품질은 사용하는 모델 크기·참조 음성 조건에 따라 달라질 수 있습니다.

포트 맵과 동시 실행

각 앱은 고정된 포트에서 실행됩니다.

포트 실행 파일
7860 MioTTS run_windows.bat
7861 Qwen (clone/custom) run_qwen_windows.bat
7862 Qwen (design) run_qwen_design_windows.bat

세 개를 동시에 띄울 수 있습니다. 다만 각 프로세스가 GPU 메모리를 따로 차지한다는 점에 유의해야 합니다. 8GB VRAM 환경에서 1.7B 모델 여러 개를 동시에 돌리면 부족할 수 있으니, 동시 사용 시 일부를 0.6B로 낮추거나(MODEL_SIZE / QWEN_MODEL_SIZE) 순차 사용하는 방식을 권장합니다.

두 앱의 공통 기능

두 앱은 UI 상당 부분과 후처리 기능을 공유합니다.

  • 포터블 구성 — 가상환경, 프리셋, 생성 음성, 사전, 로그 등 모든 데이터가 스크립트가 있는 폴더 안에 생성됩니다. 위치는 MIOTTS_BASE / QWEN_TTS_BASE로 변경할 수 있습니다. OneDrive 동기화 경로(바탕화면·문서)는 피하고 C:\tts\ 같은 일반 경로를 권장합니다.
  • 문장 자동 분할 합성 — 긴 텍스트를 문장 단위로 나눠 생성한 뒤 이어붙입니다. ✂️ 분할 설정 패널(구간 목표/무음)과 실시간 글자수 카운터를 제공합니다.
  • 📖 읽기 사전변환전=변환후 형식이며, 두 앱이 같은 dictionary.json 파일을 공유합니다.
  • 🎚️ 화속 — 0.5~2.0x (ffmpeg 후처리).
  • 📥 프리셋 관리 — 참조 음성을 이름 붙여 저장·재사용합니다. 생성/관리 탭의 🔄 목록 새로고침 버튼으로 다른 프로세스에서 저장한 프리셋을 반영할 수 있습니다.
  • 🎭 대화 생성 (멀티화자) — 공통 대본 문법을 사용합니다.
[철수] 아, 내일 회사가야해! 으... 가기 싫다.
[영희] 그건 그렇지만, 안가면 안되잖아.
[Pause 3s]
[철수] 내일이 일요일이라면 좋겠다.

[Pause 3s]는 pause/일시정지/쉼/무음으로 인식되고, 태그 없는 줄은 직전 화자의 연속 대사로 처리됩니다. 매핑창의 화자=목소리이름, 🔍 스크립트 검사, 🔊 사용 가능한 목소리 목록·미리듣기 패널, 대사 간격 슬라이더가 함께 제공됩니다.

  • LAN 공개 — run 스크립트가 실행 시 현재 IP와 포트를 자동 출력하며, 관리자 권한 1회 실행으로 방화벽이 자동 허용됩니다. 같은 네트워크(맥미니 등)에서 http://<PC IP>:<포트>로 접속합니다. IP 고정은 공유기 DHCP 주소 예약을 권장하고, 인터넷 직접 노출(포트포워딩)은 비권장입니다.
  • ⚠️ 이용 조건 고지 — WebUI 상단·콘솔에 표시됩니다(라이선스 참고).

파일 구성 한눈에 보기

파일 소속 용도
miotts_local.py MioTTS 메인 앱 (포트 7860)
setup_windows.bat / setup_windows.ps1 MioTTS Windows 설치
run_windows.bat / run_windows.ps1 MioTTS Windows 실행
setup_mac.sh / run.sh MioTTS macOS 설치/실행
qwen_tts_local.py Qwen 메인 앱 (포트 7861/7862)
setup_qwen_windows.bat / setup_qwen_windows.ps1 Qwen Windows 설치
run_qwen_windows.bat / run_qwen_windows.ps1 Qwen 실행 (clone/custom)
run_qwen_design_windows.bat Qwen 실행 (design 모드, 7862)
README_MioTTS.md / README_Qwen.md 문서 앱별 상세 설명서

설치 전 확인할 것

설치를 시작하기 전에 아래를 점검하면 실패를 줄일 수 있습니다.

  • GPU — 빠른 시작 안내는 Windows + NVIDIA GPU 기준입니다. MioTTS는 macOS(Apple Silicon)도 지원합니다.
  • VRAM — 1.7B 모델 여러 개를 동시에 돌릴 계획이면 8GB로는 부족할 수 있습니다. 여유가 넉넉하지 않다면 0.6B 사용이나 순차 실행을 고려하세요.
  • 디스크 여유공간 — Qwen3-TTS 첫 실행 시 모델을 수 GB 자동 다운로드하므로 저장 공간을 미리 확보하세요.
  • 설치 경로 — OneDrive 동기화 폴더(바탕화면·문서)는 피하고 C:\tts\ 같은 일반 경로를 권장합니다.

빠른 시작 (Windows · NVIDIA GPU)

MioTTS (영어·일본어)

  1. setup_windows.bat 더블클릭 (최초 1회) — 마지막에 CUDA available: True 확인
  2. run_windows.bat 더블클릭 → http://localhost:7860

Qwen3-TTS (한국어 포함 10개 언어)

  1. setup_qwen_windows.bat 더블클릭 (최초 1회)
  2. run_qwen_windows.bat 더블클릭 → http://localhost:7861 — 첫 실행은 모델 자동 다운로드(수 GB)로 오래 걸립니다
  3. 목소리 창조가 필요하면 run_qwen_design_windows.bathttp://localhost:7862 (design에서 만든 목소리를 "프리셋으로 저장" → clone 모드에서 반복 사용)

다른 기기에서 접속할 계획이면 각 run bat을 우클릭 → 관리자 권한으로 실행을 최초 1회 진행합니다(포트별 방화벽 규칙 자동 추가).

자주 겪는 문제와 해결

증상 조치
CUDA available: False NVIDIA 드라이버 업데이트 후 해당 venv에서 pip install torch torchaudio --index-url https://download.pytorch.org/whl/cu126 --force-reinstall
VRAM 부족(OOM) 동시 실행 중인 다른 TTS 종료, 모델 크기 0.6B로 축소 (Qwen design은 1.7B 고정)
다른 기기에서 접속 안 됨 ① 본체 localhost:포트 확인 ② 콘솔 출력 IP·포트 확인 ③ 해당 포트 방화벽 허용 ④ 같은 공유기인지 확인
MioTTS에 한국어 입력 시 이상한 발음 정상 — MioTTS는 영어·일본어만 지원. 한국어는 Qwen 사용
winget 설치 직후 명령 못 찾음 PowerShell 창 새로 열고 setup 재실행

앱별 전체 문제 해결 표는 각 README(README_MioTTS.md / README_Qwen.md)를 참고하세요.

라이선스와 이용 조건

⚠️ 주의: 아래 언급된 모델 카드·라이선스·상업적 이용 가능 여부는 변경되었을 수 있습니다. 반드시 Hugging Face 각 모델 카드 등 공식 출처에서 최신 정보를 직접 확인하시기 바랍니다. 본 글은 정보 제공 목적이며 법률적 조언이 아닙니다.
  • MioTTS 기본 프리셋 4종(jp_female/jp_male/en_female/en_male)은 상업적 이용이 금지됩니다(원본 배포자 고지: T5Gemma-TTS·gemini-2.5-pro-tts로 생성된 음성). 모델 자체는 크기별 라이선스(0.6B·1.7B Apache 2.0 등)를 따르므로 모델 카드를 확인하세요.
  • Qwen3-TTS: 코드 저장소는 Apache 2.0입니다. 모델 가중치의 라이선스·상업적 이용 가능 여부는 Hugging Face 각 모델 카드에서 직접 확인 후 사용해야 합니다.
  • 실존 인물의 목소리를 본인 동의 없이 클론·이용하는 행위, 딥페이크·기만·명예훼손 목적의 사용은 금지됩니다.
  • 두 도구로 생성한 결과물의 이용에 대한 모든 법적 책임은 전적으로 사용자 본인에게 있으며, 제작자·배포자는 책임을 지지 않습니다.
  • 위 조건에 동의하지 않는 경우 사용하지 마세요. 사용 시 동의한 것으로 간주됩니다.
GitHub - flutterkage2k/qwen3tts_miotts_custom: 로컬 TTS 통합 패키지 — MioTTS(영어·일본어) + Qwen3-TTS(한국어 포함 10개 언어). 보이스 클론, 멀티화자 대화, 자연어 목소리 창조(design 모드), bat 더블클릭 설치 지원
로컬 TTS 통합 패키지 — MioTTS(영어·일본어) + Qwen3-TTS(한국어 포함 10개 언어). 보이스 클론, 멀티화자 대화, 자연어 목소리 창조(design 모드), bat 더블클릭 설치 지원 - flutterkage2k/qwen3tts_miotts_custom