ElevenLabs 한국어 TTS 설정: 음성·모델 선택과 속도·Stability 조정 순서
ElevenLabs 한국어 음성은 한국어 샘플이 있는 음성과 Multilingual 계열 모델을 고른 뒤, 속도 1.0·Stability 약 50·Similarity 약 75·Style 0에서 한 항목씩 조정합니다.
- 분야
- 사용법
- 공식 자료
- 2개
- 읽는 시간
- 8분
- 최종 확인
- 2026.09.24
음성·모델 선택 기준
ElevenLabs의 출력 품질은 설정 슬라이더보다 음성과 모델 선택의 영향을 먼저 받습니다. 공식 안내도 중요도를 음성, 모델, 설정 순서로 설명합니다. 한국어 텍스트를 입력해도 영어 억양 음성은 한국어 샘플이 있는 음성과 같은 결과를 내지 않으므로, Voice Library에서 Korean 또는 목표 지역 억양의 샘플을 듣고 실제 대본과 비슷한 성별·연령·톤을 선택해야 합니다.
긴 내레이션에서 일관성이 중요하다면 Eleven Multilingual v2를 먼저 비교합니다. 빠른 응답이나 대량 API 생성이 중요하다면 Flash v2.5 또는 Turbo 계열을 시험합니다. Eleven v3는 표현력과 오디오 태그가 강점이지만, Professional Voice Clone과의 조합이 현재 최적화되어 있는지는 공식 문서에서 다시 확인해야 합니다.
플랜에 따라 출력 형식과 품질이 다를 수 있습니다. 최종 납품물이 44.1kHz PCM이나 192kbps를 요구한다면 선택한 플랜과 API 지원 형식을 먼저 확인해야 하며, 테스트 MP3만 듣고 제작 환경을 확정하지 않습니다.
기준값과 증상별 조정 항목
공식 제품 가이드는 일반적인 시작값으로 Stability 약 50, Similarity 약 75, Style 0을 제시합니다. 속도 기본값은 1.0이며 0.7부터 1.2 사이에서 조정할 수 있습니다. 다만 Eleven v3 모델에서는 속도(Speed)와 유사도(Similarity) 조절이 제공되지 않으므로, 이 두 항목은 v2 계열 모델에만 적용됩니다. 극단적인 속도는 품질을 떨어뜨릴 수 있으므로 0.05 또는 0.1 단위로 조정합니다.
증상별로 먼저 바꿀 설정과 확인할 부작용을 정리한 표입니다.
| 증상 | 먼저 바꿀 항목 | 시험 방향 | 확인할 부작용 |
|---|---|---|---|
| 문장마다 톤이 크게 변함 | Stability | 조금 높임 | 감정 표현 감소 |
| 원본 음색과 거리가 있음 | Similarity | 조금 높임 | 잡음·샘플 결함 재현 |
| 낭독이 지나치게 평평함 | Stability·문장부호 | 조금 낮추고 문장 구조 수정 | 발음 편차 증가 |
| 말이 너무 빠르거나 느림 | Speed | 0.9~1.1부터 시험 | 극단값의 자연스러움 저하 |
| 특정 단어가 계속 틀림 | 텍스트·발음 사전 | 표기와 문장 분리 | 다른 문맥의 발음 변화 |
AI 음성은 비결정적이어서 같은 설정값을 넣어도 동일한 결과가 보장되지 않습니다. 여러 설정을 동시에 바꾸면 개선 원인을 알 수 없으므로, 기준 파일을 저장하고 한 항목만 바꾼 파일과 나란히 비교해야 합니다.
음성용 한국어 대본 작성 규칙
숫자와 영문 약어는 원하는 읽기 형태로 풀어 씁니다. “2026.08.15”가 어색하게 읽히면 “이천이십육년 팔월 십오일”로 바꾸고, “API”는 프로젝트에서 원하는 발음에 따라 “에이피아이”로 시험합니다. 긴 문장을 쉼표로만 이어 붙이지 않고 의미 단위로 나눠 호흡 위치를 고정합니다.
테스트 대본 예시: “RS AI DESK 안내입니다. 오늘은 에이피아이 비용과 부가세를 확인합니다. 첫 번째 값은 천사백 원이며, 두 번째 값은 십 퍼센트입니다.”
Eleven v3에서는 웃음, 속삭임 등 지원되는 오디오 태그와 문장부호로 표현을 유도할 수 있습니다. 다만 지시 문구를 그대로 낭독하는 모델도 있으므로, 최종 출력 전에 들리지 않아야 할 설명이 포함됐는지 확인합니다. 긴 대본은 장면별로 나누되 앞뒤 문맥을 함께 제공해 억양이 끊기지 않게 합니다.
기준 음성 생성 절차

- Text to Speech 화면에서 실제 한국어 프로젝트와 억양이 맞는 음성 세 개를 즐겨찾기합니다.
- 같은 300~500자 테스트 대본에 Multilingual v2와 필요한 대체 모델을 각각 적용합니다.
- 속도 1.0, Stability 50, Similarity 75, Style 0 부근의 기준 파일을 설정값이 들어간 파일명으로 저장합니다.
- 가장 큰 문제 하나를 골라 해당 설정만 작은 단위로 변경하고, 비교 파일 두 개를 생성합니다.
- 숫자·영문·고유명사 오류는 대본 표기와 문장 분할을 수정한 뒤 같은 설정으로 다시 생성합니다.
- 이어폰과 휴대전화 스피커로 확인하고, 파일 형식, 샘플레이트, 길이, 남은 크레딧을 기록합니다.
같은 대본을 다시 생성해도 치명적인 발음 오류가 없고, 목표 영상 길이에 맞으며, 편집기가 요구하는 파일 형식으로 열리면 기준 음성이 완료된 것입니다. 상업 프로젝트라면 유료 플랜의 이용 권한과 입력 대본·복제 음성의 권리도 함께 확인해야 합니다.
발음·일관성 오류 원인과 조치
특정 단어만 틀리는 경우에는 Stability를 계속 조정하지 말고 단어 표기, 띄어쓰기, 발음 사전, 앞뒤 문맥을 먼저 확인합니다. 전체 억양이 어색하면 한국어 샘플이 있는 다른 음성으로 바꾼 뒤 같은 모델에서 비교합니다.
대본이나 설정을 수정해 새로 생성하면 크레딧이 차감될 수 있습니다. 생성 전에 같은 텍스트의 제한된 무료 재생성 표시가 보이는지 확인하고, 수정 실험은 300~500자 샘플로 끝낸 뒤 전체 대본을 한 번만 생성합니다. 한도에 도달했다면 무료 계정을 여러 개 만들어 우회하지 않고, 다음 결제 주기, 상위 플랜, 다른 정식 TTS 중 하나를 대안으로 선택해야 합니다.
브라우저에서 생성은 완료됐는데 다운로드한 파일이 열리지 않으면 지원 형식과 플랜별 품질 제한을 확인하고 MP3 기본 형식으로 다시 시험합니다. 계속 실패하면 음성 ID, 모델명, 설정값, 대본 일부, 오류 시각을 준비해 공식 지원에 문의해야 문제를 재현할 수 있습니다.
이 글의 수정 내역 · 2026-09-24
2026-09-24 보강: 공식 가이드의 'Eleven v3에서는 Speed·Similarity 미제공'을 추가하고, 인용 문서에 없는 seed 옵션 문장과 중복 출처를 제거.
참고한 출처
ElevenLabs Documentation — Text to Speech product guide (2026-08-15)
ElevenLabs Documentation — Text to Speech best practices (2026-08-15)
공식 문서 확인