AI 보이스 디자인: 한 줄의 텍스트 프롬프트로 맞춤형 목소리 생성하기
평범한 단어로 목소리를 묘사하면 Fish Audio의 Voice Design이 약 15초 만에 이를 생성합니다. 맞춤형 AI 캐릭터 목소리를 만들어 보세요 — 출시 기념 기간 동안 무료로 제공됩니다.
존재하지 않는 목소리가 필요할 때가 있습니다. 게임 속 냉소적인 로봇 조수, 다큐멘터리의 따뜻한 내레이터, 또는 팟캐스트 오프닝의 심야 라디오 호스트 같은 목소리 말이죠. 보이스 라이브러리를 뒤져봐도 다른 사람들이 이미 다 쓰고 있는 수백 개의 똑같은 목소리뿐이고, 보이스 클로닝은 실제 사람이 먼저 샘플을 녹음해야 합니다.
Voice Design은 이 문제를 다르게 해결합니다. 이제 Fish Audio에서 만나보실 수 있는 이 기능은 나이, 성별, 억양, 톤, 속도, 분위기 등을 텍스트로 묘사하여 완전히 독창적이고 맞춤화된 AI 목소리를 만들 수 있게 해줍니다. 약 15초 만에 해당 묘사를 실제 사용 가능한 음성 모델로 바꿔줍니다. 녹음도, 성우도, 라이브러리 검색도 필요 없습니다.
출시 기간 동안 Voice Design을 이용한 목소리 생성은 완전히 무료입니다 (일반적으로 생성당 2,000 크레딧 소요).
AI 보이스 디자인이란 무엇인가요?
AI 보이스 디자인이란 오디오 샘플 대신 텍스트 묘사로부터 독창적인 합성 목소리를 만드는 과정입니다. 목소리가 어떻게 들려야 하는지 설명하는 프롬프트(예: "부드러운 미국식 억양을 가진 따뜻하고 약간 허스키한 중년 내레이터")를 입력하면, AI가 해당 묘사에 맞는 완전히 새로운 목소리를 생성하며, 이는 즉시 텍스트 투 스피치(TTS)에 사용할 수 있습니다.
이는 기존 사람의 목소리를 녹음물로부터 복제하는 보이스 클로닝과 근본적으로 다릅니다. Voice Design으로 만든 목소리는 이전에 존재한 적이 없는 목소리이므로, 어디에서도 다른 사람이 사용하고 있지 않습니다.
Voice Design으로 나만의 AI 목소리를 만드는 방법 (단계별 가이드)
묘사만으로 어떻게 AI 목소리를 만드는지 궁금하신가요? 시작부터 끝까지의 전체 작업 과정을 소개합니다. Create Voice 페이지로 이동하여 Voice Design을 선택하세요.
1단계: 원하는 목소리 묘사하기
설명 박스에 상상하는 목소리를 적으세요. 구체적일수록 좋습니다. 다음의 요소들을 포함해 보세요:
- 나이 및 성별 — "30대 후반 여성"
- 억양 — "부드러운 미국식 억양", "가벼운 영국식 악센트"
- 톤 및 질감 — "허스키한", "맑은", "약간 거친"
- 속도 — "여유롭고 느긋한", "빠르고 에너지가 넘치는"
- 분위기 및 상황 — "조용한 방에서 단 한 명의 청취자에게 말하는 듯한"
어디서부터 시작해야 할지 모르겠나요? 따뜻한 심야 라디오 호스트, 다큐멘터리 내레이터, 또는 어린이 동화 구연가와 같은 내장된 추천 프롬프트를 사용하고 거기서부터 수정해 보세요.
선택 사항으로 미리보기 텍스트(샘플이 읽게 될 대본)를 추가하거나, 비워두어 시스템이 맥락에 맞는 샘플을 작성하게 할 수도 있습니다. 준비가 되었다면 Generate Samples를 누르세요. 생성에는 원래 2,000 크레딧이 소요되지만, 출시 기간 동안은 무료입니다.
2단계: 생성된 두 가지 목소리 샘플 비교 및 선택하기
Voice Design은 프롬프트로부터 두 가지의 뚜렷한 목소리 샘플을 생성합니다. 둘 다 들어보고 비교하여 가장 적합한 것을 선택하세요. 마음에 쏙 들지 않나요? 묘사를 약간 수정하고 Re-generate Samples를 누르세요. 출시 기간 동안은 반복 생성에 비용이 들지 않으므로 머릿속에 그리는 목소리와 똑같아질 때까지 다듬어 보세요.
3단계: 나만의 음성 모델로 저장하기
Continue를 누르고 선택한 샘플을 재사용 가능한 음성 모델로 전환하세요:
- 이름 및 커버 — 목소리에 정체성을 부여하세요
- 태그 — 성별, 나이, 목소리 스타일(따뜻한, 부드러운, 깊은, 숨소리가 섞인...)
- 사용 사례 — 대화형, 내레이션, 캐릭터 보이스, 소셜 미디어, 교육, 광고 또는 엔터테인먼트
그 다음, 누가 사용할 수 있는지 선택하세요:
- Public (공개) — 탐색 페이지에 표시되어 누구나 찾고 사용할 수 있음
- Unlisted (일부 공개) — 탐색에서는 숨겨지며 직접 링크를 통해서만 공유 가능
- Private (비공개) — 본인에게만 보임
해당 목소리가 실제 식별 가능한 인물을 사칭하지 않음을 확인한 후, Create Voice를 클릭하면 완료됩니다. 이제 맞춤형 AI 목소리가 라이브러리에 저장되어 모든 TTS 프로젝트에 사용할 수 있습니다. S2의 단어 수준 인라인 태그를 사용하면 모든 대사의 전달 방식을 정확하게 연출할 수도 있습니다.
추천 프롬프트로 시작하기 → — 출시 기간 동안 생성이 무료입니다.
더 좋은 Voice Design 프롬프트를 작성하는 방법
목소리의 품질은 묘사의 품질에 달려 있습니다. 평범한 결과물과 완벽한 결과물을 가르는 차이는 다음과 같습니다.
이 추천 프롬프트를 예로 들어보겠습니다:
"부드럽고 허스키한 목소리를 가진 30대 후반의 따뜻하고 친근한 심야 라디오 호스트. 가끔 가벼운 웃음 섞인 여유롭고 느긋한 속도, 마치 조용한 방에서 단 한 명의 청취자에게 말하는 듯한 느낌."
이 프롬프트가 잘 작동하는 이유:
-
페르소나 고정 ("심야 라디오 호스트") — 모델이 즉시 특성화할 수 있는 역할로, 단순히 10개의 형용사를 나열하는 것보다 강력합니다.
-
구체적인 음성 특성 축적 ("부드럽고 허스키한") — "좋은"이나 "괜찮은" 같은 모호한 단어보다 질감을 나타내는 단어가 훨씬 효과적입니다.
-
전달 방식 명시 ("가끔 가벼운 웃음 섞인 여유롭고 느긋한 속도") — 속도와 미세한 특징들이 목소리에 생명력을 불어넣습니다.
-
장면 설정 ("조용한 방에서 단 한 명의 청취자에게 말하는 듯한") — 상황 설정은 어떤 단일 형용사보다 친밀감과 에너지를 더 잘 형성합니다.
약한 프롬프트: "명료하고 기분 좋은 여성의 목소리."
강한 프롬프트: "밝은 호주식 억양과 빠르고 장난스러운 속도를 가진, 항상 미소 띠며 말하는 듯한 20대 활기찬 투어 가이드."
하나의 페르소나, 서너 가지의 감각적 세부 사항, 그리고 하나의 장면. 이것이 성공 공식입니다.
오리지널 캐릭터를 위해 구축된 캐릭터 보이스 생성기
게임, 애니메이션, 오디오북, 오디오 드라마 또는 가상 동반자를 위한 캐릭터를 제작한다면 Voice Design은 한 가지 결정적인 장점을 가진 캐릭터 보이스 생성기로 작동합니다. 바로 모든 목소리가 독창적이라는 점입니다.
라이브러리의 목소리는 수천 명의 사용자가 공유합니다. 당신의 악당 목소리가 다른 사람의 명상 앱 목소리와 같아서는 안 되겠죠. 가상의 캐릭터를 위해 실제 인물의 목소리를 클로닝하는 것은 동의 및 라이선스 문제를 야기합니다. 디자인된 목소리는 이 두 가지 문제를 모두 피해 갑니다. 실제 인물의 유사성 없이 오직 당신의 캐릭터만을 위해 만들어진 목소리이기 때문입니다.
아이디어를 얻기 위한 몇 가지 프롬프트 방향입니다 (현실적인 것부터 환상적인 것까지):
- "느릿하고 울림 있는 전달력과 연극적인 위협을 가진 고대의 거친 드래곤 목소리"
- "흥분하면 목소리가 약간 갈라지는, 말이 빠른 하이퍼액티브한 10대 소년 발명가"
- "속삭이는 듯 부드러운 톤과 의도적인 멈춤을 가진 평온한 노인 사서"
- "낮고 거친 단조로운 목소리, 세상에 지친 건조한 말투의 50대 하드보일드 형사"
- "크고 표현력이 풍부하며 항상 웃기 직전의 상태인, 굵직한 이탈리아 억양을 가진 활기찬 요리 쇼 호스트"
- "평평하고 정확하며 지나치게 차분하고, 끊어지는 듯한 로봇 특유의 억양을 가진 오류 난 우주선 AI"
생성하고, 두 샘플을 비교하고, 다듬고, 저장하세요. 단 하루 오후 만에 독창적인 전체 캐스팅을 완료할 수 있습니다. 그런 다음 다중 화자 텍스트 투 스피치를 사용하여 그들을 한 장면에 배치하거나, 다른 사용자들이 만든 AI 캐릭터 목소리를 둘러보며 영감을 얻으세요.
Voice Design vs. Voice Cloning: 어떤 것을 사용해야 할까요?
Fish Audio는 현재 목소리를 만드는 세 가지 방법을 제공하며, 각각 다른 용도로 사용됩니다.
| Voice Design | Instant Voice Clone | Professional Voice Clone | |
|---|---|---|---|
| 입력 | 텍스트 묘사 | 약 10초 분량의 오디오 | 스튜디오급 품질의 녹음물 |
| 시간 | 약 15초 | 약 1분 | 1–2시간 |
| 추천 용도 | 독창적인 캐릭터 및 새로운 목소리 | 기존 녹음물을 빠르게 복제 | 검증된 실제 인물의 스튜디오급 클론 |
| 목소리 존재 여부 | 아니오 — 처음부터 생성됨 | 예 | 예 — 소유권 검증 포함 |
기억해야 할 규칙: 목소리가 아직 존재하지 않는다면 디자인하세요. 이미 존재한다면 클로닝하세요.
디자인을 통한 독창성
디자인된 목소리에는 언급할 가치가 있는 또 다른 조용한 혜택이 있습니다. 바로 누구의 것도 빌려오지 않는다는 점입니다. 모든 Voice Design 결과물은 특정 개인의 녹음이 아닌 텍스트 묘사로부터 생성됩니다. 또한 Fish Audio에서 생성된 모든 목소리는 실제 식별 가능한 인물을 사칭하지 않는다는 확인을 거쳐야 합니다. 이는 여러분의 프로젝트가 동의 및 목소리 초상권 문제로부터 자유로울 수 있도록 설계된 워크플로우입니다.
필요한 목소리가 실제 인물(본인 또는 성우)의 것일 때, 저희는 그 경계를 흐리는 것이 아니라 소유권을 명확히 하는 것이 정답이라고 믿습니다. 전 세계의 성우들은 바로 이를 요구하고 있습니다: AI 시대에 자신의 목소리가 어떻게 사용되는지에 대한 동의와 공정한 보상 말이죠. 이것이 저희의 새로운 Professional Voice Clone 뒤에 담긴 생각입니다. 실시간 소유권 검증을 기반으로 구축된 실제 인물의 검증된 스튜디오급 클론이며, 목소리 소유자를 위한 상업적 출시 옵션과 수익 공유 모델을 제공합니다. 이는 목소리 소유자와 그 목소리를 사용하려는 사람들 사이의 더 깨끗한 거래를 위한 시작입니다. 이에 대해서는 곧 업로드될 심층 분석에서 더 자세히 다루겠습니다.
15초 만에 첫 번째 목소리 디자인하기
딱 맞는 목소리를 찾기 위해 성우 오디션을 보고, 라이브러리를 뒤지고, 혹은 "비슷한 정도"에서 타협해야 했던 시대는 지났습니다. 이제는 좋은 문장 하나를 쓰는 것으로 충분합니다.
첫 번째 목소리 무료로 디자인하기 → — 출시 기간 동안 무료입니다.
자주 묻는 질문
AI 보이스 디자인이란 무엇인가요?
Voice Design은 무료인가요?
보이스 디자인과 보이스 클로닝의 차이점은 무엇인가요?
디자인된 목소리를 상업적으로 사용할 수 있나요?
좋은 보이스 디자인 프롬프트를 작성하려면 어떻게 해야 하나요?
Sabrina is part of Fish Audio's support and marketing team, helping users get the most out of AI voice products while turning launches, updates, and customer insights into clear, practical content.
Sabrina Shu의 더 많은 글 보기