텍스트를 음성(MP3)으로 만드는 방법 — 윈도우 기본 기능부터 자막 더빙까지
유튜브 영상에 내레이션을 넣거나, 강의 자료에 안내 멘트를 깔거나, 자막 파일을 그대로 더빙하려면 사람이 읽어 녹음하는 대신 텍스트를 음성으로 바꾸면 됩니다. 방법은 크게 세 가지입니다. 윈도우에 이미 들어 있는 음성을 쓰는 방법, 신경망 음성을 쓰는 무료 프로그램, 그리고 클라우드 서비스입니다. 목소리 품질, 인터넷 필요 여부, 상업적 이용 조건이 서로 달라서 용도에 따라 갈립니다. 각각 어떻게 하는지와 자막을 더빙할 때 반드시 부딪히는 문제 하나를 정리했습니다.
텍스트나 자막 파일(.srt·.vtt)을 Edge 신경망 음성으로 읽어 MP3로 저장합니다. 가입·API 키 없이 설치 파일 하나로 끝나고, 한국어·영어·중국어·일본어를 지원합니다.
세 가지 방법과 고르는 기준
텍스트를 음성으로 바꾸는 기술을 TTS(Text To Speech)라고 합니다. 예전에는 기계음 같은 목소리뿐이었지만, 지금은 신경망으로 만든 음성이 보급되면서 짧은 문장은 사람이 읽은 것과 구분하기 어려운 수준이 됐습니다. 다만 그 좋은 음성은 대부분 인터넷 너머의 서버에서 만들어집니다. 그래서 선택은 대체로 품질과 조건 사이의 교환입니다.
| 방법 | 목소리 | 조건 |
|---|---|---|
| 윈도우 기본 음성 (PowerShell) | 기계적 | 설치·인터넷 불필요, WAV 저장 |
| 무료 프로그램 (Voxsave 등) | 자연스러움 | 인터넷 필요, 윈도우용, MP3·자막 지원 |
명령어 도구 (edge-tts) | 자연스러움 | 파이썬 설치 필요, 자동화·일괄 처리에 유리 |
| 클라우드 서비스 (클로바더빙·ElevenLabs 등) | 자연스러움 | 가입 필요, 무료 한도와 상업적 이용 조건 |
짧은 안내 멘트 한두 개라면 윈도우 기본 음성으로 충분합니다. 영상 내레이션처럼 사람이 계속 듣는 소리라면 신경망 음성 쪽이 확실히 낫습니다. 억양이 기계적이면 내용과 상관없이 끝까지 듣기 어렵습니다.
윈도우에 들어 있는 음성으로 WAV 만들기
윈도우에는 음성 합성 기능이 기본으로 들어 있습니다. 내레이터나 Edge의 소리 내어 읽기가 쓰는 그 기능인데, 파일로 저장하는 버튼은 어디에도 없습니다. PowerShell 을 쓰면 같은 음성으로 WAV 파일을 만들 수 있습니다. 시작 메뉴에서 PowerShell 을 열고 아래를 붙여 넣으세요.
Add-Type -AssemblyName System.Speech
$s = New-Object System.Speech.Synthesis.SpeechSynthesizer
# 쓸 수 있는 음성 목록 보기
$s.GetInstalledVoices() | ForEach-Object { $_.VoiceInfo.Name + " (" + $_.VoiceInfo.Culture + ")" }
# 음성 고르고 속도 조절 (-10 ~ 10, 0이 기본)
$s.SelectVoice("Microsoft Heami Desktop")
$s.Rate = 0
# 파일로 저장
$s.SetOutputToWaveFile("C:\temp\narration.wav")
$s.Speak("안녕하세요. 오늘은 텍스트를 음성으로 바꾸는 방법을 정리해 보겠습니다.")
$s.Dispose()한국어 윈도우라면 보통 Microsoft Heami Desktop(한국어 여성)과 Microsoft Zira Desktop(영어) 정도가 들어 있습니다. 긴 대본은 텍스트 파일을 읽어 그대로 넘기면 됩니다. 아래처럼 하면 대본 파일 하나가 음성 파일 하나가 됩니다.
Add-Type -AssemblyName System.Speech
$s = New-Object System.Speech.Synthesis.SpeechSynthesizer
$s.SetOutputToWaveFile("C:\temp\narration.wav")
$s.Speak((Get-Content "C:\temp\script.txt" -Raw -Encoding UTF8))
$s.Dispose()설정 → 시간 및 언어 → 음성에서 음성을 추가해도 위 목록에 안 나오는 경우가 많습니다. 최근 윈도우가 추가하는 음성은 예전 방식(SAPI)과 다른 자리에 등록되는데, PowerShell 의 System.Speech 는 예전 자리만 읽기 때문입니다. 실제로 이 글을 쓴 PC(윈도우 11 25H2)에서도 목록에 없는 음성이 하나 더 설치돼 있었습니다. 목록에 나오는 음성만 이 방법으로 쓸 수 있다고 보면 됩니다.
- 저장되는 형식은 WAV 입니다. 용량이 크니 MP3 가 필요하면 별도로 변환해야 합니다.
- Edge 브라우저의 소리 내어 읽기는 훨씬 자연스러운 음성을 쓰지만, 그 소리를 파일로 저장하는 기능은 없습니다.
$s.Rate는 -10에서 10 사이입니다. 안내 멘트는 0~2 정도가 알아듣기 좋습니다.
자연스러운 음성으로 MP3 만들기 — 무료 프로그램
Microsoft Edge 브라우저가 읽어 주는 목소리는 신경망으로 만든 음성이라 훨씬 자연스럽습니다. 이 음성을 파일로 저장해 주는 무료 프로그램이 있습니다. 이 사이트에서 만든 Voxsave 도 그중 하나로, 텍스트를 붙여 넣거나 자막 파일을 끌어다 놓으면 MP3 로 저장합니다.
- 1프로그램을 받아 실행하고, 대본을 붙여 넣거나 자막 파일(.srt·.vtt)을 창에 끌어다 놓습니다.
- 2음성을 고릅니다. 한국어는 여성(SunHi)·남성(InJoon) 음성이 있고, 다국어 음성도 있습니다.
- 3속도와 음높이를 조절하고 미리듣기로 확인합니다.
- 4저장을 누르면 MP3 파일이 만들어집니다.
- 가입·로그인·API 키가 필요 없습니다.
- 미리듣기는 인터넷 없이도 되지만, MP3 저장에는 인터넷이 필요합니다. 음성 합성 자체를 마이크로소프트 서버가 처리하기 때문입니다.
- 윈도우 10(1803 이상)·11 전용입니다.
- 코드 서명이 없는 무료 프로그램이라 처음 실행할 때 SmartScreen 경고가 뜹니다. 추가 정보 → 실행으로 넘어가면 됩니다.
이런 도구들은 Edge 가 쓰는 마이크로소프트의 음성 서비스를 그대로 호출합니다. 개인적인 용도로 쓰는 데에는 무리가 없지만, 광고나 수익 콘텐츠처럼 규모가 있는 상업적 사용이라면 마이크로소프트의 이용 약관을 한 번 확인하고 쓰는 편이 안전합니다.
명령어로 자동화하기 — edge-tts
같은 음성을 명령어로도 쓸 수 있습니다. 파이썬이 설치돼 있다면 edge-tts 를 설치해 대본 여러 개를 한 번에 돌리거나 다른 작업과 묶을 수 있습니다.
pip install edge-tts
# 텍스트 → MP3, 자막(.srt)도 함께 생성
edge-tts --text "Hello, world!" --write-media hello.mp3 --write-subtitles hello.srt
# 쓸 수 있는 음성 목록
edge-tts --list-voices
# 대본 파일을 한국어 음성으로 읽어 MP3 로 저장
edge-tts --voice ko-KR-SunHiNeural --file script.txt --write-media narration.mp3
# 속도·음량·음높이 조절
edge-tts --rate=-50% --text "Hello, world!" --write-media slower.mp3
edge-tts --volume=-50% --text "Hello, world!" --write-media quieter.mp3
edge-tts --pitch=-50Hz --text "Hello, world!" --write-media lower.mp3위 예시는 edge-tts 공식 문서와 명령행 도움말에 있는 옵션 그대로입니다. 폴더 안의 대본을 반복문으로 돌리면 여러 편을 한 번에 만들 수 있습니다. 창이 있는 프로그램이 편한 분에게는 앞 절의 방법이, 같은 작업을 반복하는 분에게는 이쪽이 맞습니다.
자막 파일을 더빙할 때 — 길이가 맞지 않는 문제
자막 파일에는 각 줄이 화면에 떠 있는 시간이 적혀 있습니다. 그런데 그 문장을 소리 내어 읽으면 대개 자막 구간보다 길어집니다. 사람은 자막을 눈으로 빠르게 읽지만, 읽어 주는 음성은 또박또박 발음하기 때문입니다. 영어 자막을 한국어로 번역해 더빙하면 차이가 더 벌어집니다.
- 속도를 조금 올립니다. 10~20% 정도는 부자연스럽지 않게 들립니다.
- 문장을 줄입니다. 자막을 그대로 읽을 필요는 없습니다. 같은 뜻을 짧게 다시 쓰면 잘 맞습니다.
- 줄을 합칩니다. 짧은 자막 두 줄을 한 문장으로 합치면 앞뒤 여유가 생깁니다.
- 정확한 동기화가 필요하면 영상 편집 프로그램에서 구간별로 오디오를 잘라 붙이는 편이 빠릅니다.
반대로 자막이 아니라 새 영상을 만드는 경우라면 순서를 바꾸는 편이 낫습니다. 먼저 대본을 음성으로 만들고, 그 음성 길이에 맞춰 화면을 배치하면 길이를 맞추느라 고생할 일이 없습니다.
클라우드 서비스와 상업적 이용
가입해서 쓰는 서비스는 목소리 선택지가 많고 감정 표현도 세밀합니다. 대신 무료로 쓸 수 있는 양이 정해져 있고, 만든 음성을 어디에 쓸 수 있는지가 요금제에 따라 다릅니다. 수익이 걸린 콘텐츠라면 이 부분을 먼저 보고 시작해야 합니다.
| 서비스 | 무료로 쓸 수 있는 양 | 상업적 이용 |
|---|---|---|
| 네이버 클로바더빙 | 월 다운로드 횟수와 글자 수에 한도 | 무료는 출처 표기 조건, 광고·홍보용은 유료 요금제 |
| ElevenLabs | 월 10,000 크레딧(대략 10분 분량) | 무료 요금제에는 상업 라이선스가 없음 (유료는 월 6달러부터) |
| Edge 신경망 음성 (Voxsave·edge-tts) | 한도 없음 | 마이크로소프트 이용 약관 확인 필요 |
위 숫자는 2026년 9월 기준이고, 이런 서비스의 무료 한도와 라이선스 조건은 자주 바뀝니다. 실제로 쓰기 전에 각 서비스의 요금제 페이지에서 다시 확인하세요. 특히 '무료로 만들 수는 있지만 수익 콘텐츠에는 쓸 수 없는' 조건이 흔합니다.
음성 자체의 권리와 별개로 생각할 것이 하나 더 있습니다. 실제 사람의 목소리를 복제하는 기능은 본인 동의 없이 쓰면 문제가 됩니다. 기본으로 제공되는 음성만 쓰는 편이 안전합니다.
자주 묻는 질문
Q. 만든 WAV 파일을 MP3로 바꾸려면?
영상 편집 프로그램에 그대로 넣을 거라면 WAV 그대로 써도 됩니다. 파일 크기를 줄이려면 변환 도구를 쓰세요. 명령어가 익숙하다면 ffmpeg -i narration.wav narration.mp3 한 줄이면 됩니다.
Q. 한국어 음성이 목록에 없습니다.
설정 → 시간 및 언어 → 언어 및 지역에서 한국어가 설치돼 있는지 확인하고, 음성 항목에서 음성을 추가하세요. 다만 새로 추가한 음성은 PowerShell 의 System.Speech 목록에는 안 나올 수 있습니다. 그럴 때는 Edge 신경망 음성을 쓰는 프로그램 쪽이 빠릅니다.
Q. 긴 대본이 중간에서 잘립니다.
문단 단위로 나눠 저장한 뒤 합치는 방법이 가장 안전합니다. 마지막 문장 뒤에 빈 줄을 한두 줄 넣으면 끝이 잘리는 증상이 줄어듭니다.
Q. 유튜브 영상에 써도 저작권 문제가 없나요?
만든 음성을 어디에 쓸 수 있는지는 사용한 서비스의 약관에 달려 있습니다. 무료 요금제가 상업적 이용을 막아 두는 경우가 흔하니, 수익 창출 영상이라면 해당 서비스의 라이선스 항목을 먼저 확인하세요. 대본 자체가 남의 글이라면 그건 또 다른 문제입니다.
Q. 인터넷 없이 자연스러운 음성을 쓸 수는 없나요?
윈도우 11 의 내레이터에는 기기 안에서 동작하는 자연스러운 음성이 있지만, 그 소리를 파일로 저장하는 기능은 제공되지 않습니다. 파일이 필요하면서 인터넷도 쓸 수 없다면 앞에서 다룬 윈도우 기본 음성이 현실적인 선택입니다.
텍스트나 자막 파일(.srt·.vtt)을 Edge 신경망 음성으로 읽어 MP3로 저장합니다. 가입·API 키 없이 설치 파일 하나로 끝나고, 한국어·영어·중국어·일본어를 지원합니다.