1 周年。

$52M 种子轮。

8M+ 创作者。

阅读我们的故事
2026年1月22日指南

如何在 TikTok 上使用文字转语音:创作者全攻略教程

如何在 TikTok 上使用文字转语音:创作者全攻略教程

TikTok 上的文字转语音(Text-to-speech, TTS)功能可以将您输入的文字标题转化为语音,让 AI 声音为您解说内容,而无需您亲自录制音频。该功能已成为该平台的标志性元素——也就是您在无数视频中听到的那种熟悉的“TikTok 声音”,用于朗读字幕、讲述笑话或解释教程。

无论您是想在不亲自出镜的情况下添加配音,还是想让内容对视障观众更具可访问性,亦或是只想紧跟这一成熟的内容风格,只要找到入口,TikTok 的 TTS 功能就非常易于使用。本指南涵盖了基础流程、声音选择、常见故障排除技巧,以及在 TikTok 内置声音无法完全满足需求时的进阶替代方案。

TikTok 文字转语音的功能

TikTok 的文字转语音功能可将您添加到视频中的任何文本叠加层转换为语音。AI 生成的声音会大声朗读您的标题,并与您的视频内容同步。观众在看到屏幕文字的同时也能听到朗读声,这对于教程、讲故事、评论和无障碍访问特别有用。

该功能于 2020 年底推出,并持续受到欢迎。不列颠哥伦比亚大学 (UBC) 尚德商学院的研究发现,使用 AI 语音的创作者产出的视频比不使用的创作者多 24%,这表明该功能显著降低了制作门槛。

TikTok 在不同语言、口音和角色风格中提供多种声音选项——从广受欢迎的“Jessie”声音(通常被称为“TikTok 声音”或“Siri 声音”)到诸如 Ghostface 和迪士尼主题角色等新奇选项。

第一步:录制或上传您的视频

首先,创建将配合 TTS 旁白的视频内容。

  1. 打开 TikTok,点击屏幕底部中央的 “+” 按钮。
  2. 拍摄新片段或点击 上传 从相册中选择现有视频。
  3. 如果使用多个剪辑,请完成初始剪辑或排列。

您的视频不需要包含录制的音频——TTS 在无声素材、背景音乐甚至您想要补充旁白的现有音频上都能完美运行。

第二步:为视频添加文字

TTS 是将文本叠加层转换为语音,因此您需要先添加文字。

  1. 录制或上传后,点击右侧编辑菜单中的 文字 按钮。
  2. 输入您希望 AI 声音朗读的话语。
  3. 点击 完成 将文字放置在视频上。

文字技巧:

● 为了更好的节奏感,建议每个文本框保持在 1-2 句话。

● 对于多语言 TikTok 视频,建议先使用 subtitle translator 准备好屏幕文字,并在应用文字转语音前进行校对。

● 标点符号会影响语调:句号产生停顿,逗号产生短促间隔,问号则会调整语调。

● 对于较长的旁白,请创建多个文本框并分别为每个文本框应用 TTS。

您可以调整文字的位置、字体、颜色和大小。这些视觉设置不会影响 TTS 音频,但会影响观众边听边看的体验。

第三步:应用文字转语音

这是见证奇迹的时刻。

  1. 点击您刚刚创建的文本框。
  2. 从弹出的菜单中选择 文字转语音
  3. 浏览可用的声音选项。
  4. 选择符合您内容基调的声音。
  5. 点击 完成 以应用。

现在播放视频时,AI 声音就会朗读您的文字。预览效果以确保时机和声音选择适合您的内容。

为多个文本框应用 TTS:

如果您创建了多个文本叠加层,可以将同一种声音应用到所有文本框:

  1. 选择一种声音后,寻找 “将声音应用到此视频中的所有文字” 选项。
  2. 点击它,在所有文本框中使用相同的 TTS 声音。

这可以节省时间并确保整个视频旁白的一致性。

第四步:选择合适的声音

TikTok 提供各种语音类别,但可用性可能因地区和应用版本而异:

标准声音:

Jessie —— 原始的“TikTok 声音”,女性,清晰且略带欢快

Joey —— 男性声音,常用于幽默和旁白

Eddie —— 音调独特的男性声音

Rocket —— 更具机器人感、辨识度极高的声音

Alex, Chris, Taylor, Kendall —— 其他性格的声音

角色声音:

Ghostface —— 来自《惊声尖叫》的反派声音

Stitch —— 来自《星际宝贝》

C-3PO, Stormtrooper —— 《星球大战》角色

Chewbacca —— 独特的低吼式语言

季节性和特殊声音:

● 圣诞老人、万圣节主题声音以及其他轮换选项

声音选择技巧:

● 让声音基调匹配内容的氛围——Jessie 适合日常或欢快的视频,而 Ghostface 则适合戏剧性或恐怖主题。

● 角色声音能吸引注意力,但在教学或教育类内容中可能会让人分心。

● 在最终决定前测试多种声音——预览每个选项。

● 热门声音辨识度很高,这可能会根据您的目标提升或损害互动率。

第五步:设置文字时长(持续时间)

控制您的 TTS 文字何时出现和消失:

  1. 点击视频上的文本框。
  2. 选择 设置时长(或拖动屏幕底部的文字时间轴)。
  3. 调整起点和终点以匹配您的视频节奏。

TTS 音频将在文字出现在屏幕上时播放。对于多个文本框,请交错调整其时间,以创建流畅、连贯的叙事。

时间设置最佳实践:

● 给观众足够的阅读时间(即使有音频,许多人也会同步阅读)。

● 让文字出现的时间与相关的画面匹配。

● 在文本框之间留出短暂的空隙,创造自然的节奏。

第六步:调整音频电平

平衡 TTS 音量与背景音乐或其他音频:

  1. 点击编辑屏幕顶部的 添加音乐
  2. 如果您正在使用背景音乐,点击 音量
  3. 调低原声或背景音乐,确保 TTS 清晰可闻。
  4. 在最终确认前预览音频平衡。

为了清晰起见,TTS 通常需要比背景音乐响亮。一个通用的准则是将 TTS 设置为 100%,背景音乐设置为 20-40%。

第七步:发布视频

当一切听起来都完美时:

  1. 点击 下一步 进入发布页面。
  2. 添加标题、话题标签和任何其他设置。
  3. 点击 发布 以发布视频。

您的视频现在将带上 AI 生成的配音进行播放,所有观众都可见且可听。

常见 TTS 问题排查

文字转语音选项未出现:

● 将您的 TikTok 应用更新到最新版本。

● 该功能可能在您所在的地区暂时不可用。

● 尝试关闭并重新打开应用。

声音选项有限或缺失:

● 某些声音具有地区针对性,或会定期轮换。

● 角色声音可能受版权许可限制。

● 检查应用更新——新声音会定期添加。

TTS 音频听起来不对劲:

● 检查标点符号——缺少句号可能导致语句连读。

● 缩写可能会被按字面意思朗读(例如 "Dr." 与 "Doctor")。

● 数字和特殊字符可能导致非预期的发音。

音量太低:

● 调低背景音乐音量。

● 确保预览时您的设备音量已开启。

● 某些声音天生比其他声音小。

在 TikTok 中使用外部 TTS 工具

TikTok 的内置声音在快速制作内容时效果很好,但它们有一定的局限性。这些声音带有明显的“TikTok 标签”,定制化选项极少,且可用性会有波动。希望对配音有更多控制权的创作者通常会选择在外部生成音频并导入 TikTok。

外部 TTS 工作流:

  1. 使用第三方 TTS 生成器创建您的音频文件。
  2. 下载 MP3 或 WAV 文件。
  3. 将音频导入视频编辑器(如 CapCut、InShot 或类似应用)。
  4. 将配音与您的视频内容对齐。
  5. 导出最终视频并上传到 TikTok。

这种方法虽然更耗时,但具有显著优势,包括更自然的声音、不依赖 TikTok 轮换选项的持续可用性以及高级定制功能。

何时使用外部 TTS 更有意义:

对于需要更具表现力、更自然的声音,或者制作多语言内容的创作者来说,外部 TTS 工具通常能提供 TikTok 内置选项无法企及的质量。Fish Audio 的表现非常适合 TikTok 内容,因为其声音听起来明显更像真人而非机器人,且情感标签系统允许创作者无需复杂配置即可调整语调。

Fish Audio 的 S1 模型通过在文本中插入简单的标签——如 (excited)、(nervous)、(confident)——即可生成带有情感控制的自然语音,从而影响每一行的表达方式。这对于通过情感变化吸引观众的讲故事类内容特别有用。

该平台支持八种语言的完整情感功能:英语、中文、日语、德语、法语、西班牙语、韩语和阿拉伯语。对于制作国际化内容或双语视频的创作者来说,这种覆盖范围可以满足大多数常见需求,而无需使用多个工具。

如果您想要一致的语音形象,声音克隆是另一个选择。Fish Audio 仅需 10 秒的参考音频即可创建自定义声音,让您无需手动录制每一次配音就能建立极具辨识度的频道身份。

Fish Audio logo

Fish Audio 描述内容:

带有 TikTok 风格旁白文字的 Fish Audio TTS 界面建议操作:

  1. 访问 fish.audio
  2. 输入带有情感标签的 TikTok 旁白样本文本
  3. 截取界面截图 标注:展示情感标签语法 建议尺寸:1200x700 文件名:fish-audio-tiktok-voice-example.png

其他外部 TTS 选项:

ElevenLabs 提供极具表现力的声音,深受专业创作者欢迎。Murf AI 为教育和解释类内容提供强大的定制选项。像 Gesserit 和 TikTokVoice 这样的在线生成器对于基于桌面端的工作流非常有用。

TikTok 的创意 TTS 构思

讲故事: 使用 TTS 讲述故事,同时展示相关的视觉效果、辅助镜头(B-roll)或文字动画。AI 语音提供了一致的叙述者,无需配音技巧。

教程内容: TTS 引导观众完成步骤,而您的视频则演示过程。这种方法对于烹饪、手工艺和“如何做”类内容特别有效。

反应/评论: 在展示您正在回应的内容时,通过 TTS 添加您的想法。当您不想出镜但仍想传达个性时,这非常有效。

合拍(Duets)和拼接(Stitches): 为其他创作者的内容添加 TTS 评论,制作反应类视频。

辅助功能: TTS 让您的内容对视障观众或有阅读障碍的观众更具可访问性。这是扩大潜在受众群体的实用方式。

总结

在 TikTok 上添加文字转语音遵循一个简单的流程:在视频中添加文字,点击文字,选择文字转语音,然后选择声音。该功能消除了录音障碍,增加了可访问性,并利用了观众认可并乐于互动的成熟内容风格。

对于希望获得超越 TikTok 内置选项(更自然、更具表现力或更具一致性)的创作者来说,Fish Audio 等外部 TTS 工具提供了显著的升级。额外增加的工作流步骤在语音质量和创意控制方面是值得的。

从 TikTok 原生的 TTS 开始学习格式,随着您的内容对高质量音频需求的增加,再扩展到外部工具。

常见问题解答

为什么我在 TikTok 上找不到文字转语音选项?
这通常是因为应用版本过旧或地区限制。请尝试将 TikTok 更新到最新版本,或者尝试重新启动应用。
我可以在 TikTok 上克隆我自己的声音吗?
TikTok 本身不提供声音克隆,但您可以使用像 Fish Audio 这样的外部工具。只需上传 10 秒您的语音样本,克隆后即可将其生成的音频导入 TikTok。
TikTok 视频中 TTS 和背景音乐的最佳音量比例是多少?
为了确保旁白清晰,通常建议将 TTS 音量设为 100%,而将背景音乐降低到 20-40% 之间。
Kyle Cui

Kyle CuiX

Kyle is a Founding Engineer at Fish Audio and UC Berkeley Computer Scientist and Physicist. He builds scalable voice systems and grew Fish into the #1 global AI text-to-speech platform. Outside of startups, he has climbed 1345 trees so far around the Bay Area. Find his irresistibly clouty thoughts on X at @kile_sway.

阅读Kyle Cui的更多内容

创造真实感的声音

立即开始生成最高质量的音频。

已有账号? 登录