面向 AI 视频的声音克隆,较替代方案以 3:1 胜出。
HeyGen 如何从 ElevenLabs 迁移到 Fish Audio,以解决非美式英语口音下的声音相似度问题,并在并排对比中看到用户以三比一选择 Fish。
HeyGen 如何从 ElevenLabs 迁移到 Fish Audio,以解决非美式英语口音下的声音相似度问题,并在并排对比中看到用户以三比一选择 Fish。
在 HeyGen 的并排用户对比中,Fish Audio 相较其他 TTS 提供商获得的选择率。
John Wu
HeyGen 音频工程经理
"Fish 是一个非常出色的语音模型,能够最大化非常独特声音的相似度。"
Fish Audio 首席执行官
Rissa Cao

"HeyGen 是最考验声音克隆质量的场景。知识创作者需要的不是一个听起来像他们的声音,而是一个真正像他们的声音,连口音也要保留下来。这个标准,也就是大多数 TTS 模型离开美式英语后会被拉平的标准,正是我们打造 S2 Pro 要跨越的标准。看到 HeyGen 用户在并排测试中以三比一选择 Fish,正是我们为这个模型而追求的验证。"

HeyGen 是领先的 AI 视频平台,服务于知识型创作者,包括教育者、课程构建者、商业沟通者,以及把专业知识规模化转化为视频内容的创作者。该平台让创作者无需摄影棚设备、专业配音演员或数周制作周期,也能生成专业 AI 视频。
声音位于 HeyGen 生成的每一支视频中心。对于受众已经熟悉其声音的知识型创作者来说,AI 声音必须就是他们自己的声音,不是通用旁白,也不是相近替代,而是带有受众熟悉口音的真实声音。这正是 AI 视频声音克隆必须达到的标准。
在评估 Fish Audio 之前,HeyGen 使用 ElevenLabs 作为 AI 视频生成流程中的 TTS 层。平台可以运行,声音也清晰可懂。但用户反馈中持续出现一个结构性问题:声音相似度不足,尤其影响拥有非美式英语口音的创作者。
知识型创作者会带着自己的口音说话。澳大利亚创作者听起来就应该像澳大利亚人,印度创作者听起来就应该像印度人。英式、南非、新加坡、爱尔兰、苏格兰、菲律宾、加勒比等全球英语口音版图,对 HeyGen 来说不是边缘情况,而是国际创作者群体的真实形态。
如果一个 TTS 能做好美式英语,却把其它口音都压平成接近中性美式英语的声音,就会破坏 AI 视频声音克隆的核心承诺:视频里的声音应该像你。HeyGen 的非美式英语口音用户一直在反馈口音保持问题;克隆声音没有保留创作者期望的口音身份。


HeyGen 评估了整个 TTS 市场,以解决非美式英语口音问题。面向非美式英语口音的 TTS 不是功能对比,而是 HeyGen 国际创作者基础的生存级评估标准。
在测试过的供应商中,美式英语声音克隆质量与非美式英语声音克隆质量之间的差距始终存在,而且方向并不理想。多数 TTS 模型先以美式英语训练,再适配其它口音。这种适配最终表现为克隆声音中的 韵律被压平、元音被中和,以及明显的口音身份流失 。
Fish Audio 之所以被 HeyGen 选中,最关键的标准是:独特声音的声音克隆质量,尤其是非美式英语口音声音的克隆质量。Fish S2 Pro 模型会保留源声音的口音身份,而不是把它归一化到美式英语基线,这正是 HeyGen 在其它供应商测试中发现的失败模式。
对 HeyGen 来说,这不是技术细节,而是知识创作者的观众听到熟悉的本人,还是听到一个合成陌生人的区别。声音克隆质量,而不是延迟或成本,成为最终决定因素。

HeyGen 通过云 API 部署 Fish Audio,为客户在平台上生成的视频提供 TTS。该集成已经达到生产规模:知识型创作者通过 HeyGen 发布的每一支使用 Fish 声音的视频,都会经过 Fish 的 S2 Pro 模型。
最有说服力的用户信号不是赞美,而是曾经最响亮的投诉消失了。迁移之后,HeyGen 创作者群体出现了三个信号:
使用产品:Fish Audio S2 Pro · 文本转语音(云 API)
在 HeyGen 并排对比中,Fish Audio 相比其它 TTS 供应商获得 3:1 用户选择率。
HeyGen 国际创作者群体中的非美式英语口音投诉已经停止。
在选择 Fish Audio 前评估了整个 TTS 市场,口音保持是决定因素。
为了声音克隆质量,从 ElevenLabs 迁移到 Fish Audio。