HeyGen

HeyGen 创作者选择 Fish Audio 进行声音克隆的比例,是其他方案的三倍。

HeyGen 是面向知识创作者的 AI 视频平台,教育工作者、课程开发者和商务沟通人员无需摄影棚或配音演员,即可制作专业视频。为保留全球创作者的口音,HeyGen 将其语音层迁移至 Fish Audio。

使用的产品
Fish Audio S2 Pro文本转语音 API声音克隆
迁移来源
ElevenLabs

当声音不再是美式英语时,会发生什么?

HeyGen 的创作者遍布全球。澳大利亚、印度、英国、南非、新加坡、爱尔兰、苏格兰、菲律宾和加勒比地区的创作者都说英语,但各有自己的口音。

HeyGen 原先在生产环境中使用的文本转语音方案能准确生成美式英语,却把其他口音也拉向同一个方向。韵律变得平淡,元音失去特色,让观众熟悉的创作者口音变成了近似中性美式口音。市场上的大部分模型都有这个问题:以美式英语为基础训练、再适配其他口音的模型,通常擅长美式英语,却会在其他口音上出现可预见的退化。

支持工单中最常见的声音问题

创作者立刻注意到了问题。口音相似度成为反复出现的投诉:他们的声音听起来不再像自己。更重要的是,问题恰好集中在 HeyGen 希望拓展的用户群体。全球创作者需要让声音跨越语言和口音,同时保留让人能够辨认出自己的独特身份。

HeyGen 用一个问题检验整个市场

这次评估并非功能对比。HeyGen 没有寻找延迟最低、表现力最强或支持语言最多的模型,而是将评估归结为一个更简单的问题:创作者克隆自己的声音后,听起来还像本人吗?

具体而言,HeyGen 测试模型能否保留让声音具有辨识度的口音。英国创作者能否保留自己的英国口音?声音能否在不同语言之间切换,而不会默认变成美式版本的自己?

这成为了评判标准。声音可以快速、富有表现力,技术上也很出色,但只要口音变了,就无法通过测试。

Fish 是一个非常出色的语音模型,能够最大化非常独特声音的相似度。

John Wu

HeyGen 音频工程经理

相似度胜过延迟与成本

HeyGen 选择 Fish Audio,是因为它最符合这一标准。速度和价格固然重要,却都不是决定因素。一旦模型达到了性能门槛,关键区别就很简单:哪一个能在不同口音下最忠实地还原声音?

Fish Audio 的优势在于保留原始声音的特征,而不是将其调整为统一的基准。这种一致性让 HeyGen 能将语音产品拓展至更多创作者和市场,而无需让创作者妥协于自己的声音。

结果不只是获得了更好的语音模型。它消除了 HeyGen 跨语言使用的一大障碍,也为公司的全球创作者战略奠定了更坚实的基础。

从第一周起就承载全部生产流量

HeyGen 通过 Fish Audio 云端 API 部署了 S2 Pro。创作者发布的每条使用 Fish 驱动声音的视频都由该模型处理。无需分阶段上线或试点用户群,集成立即进入生产规模。

成果:声音始终保有自我

迁移至 Fish Audio 后,HeyGen 在生产环境中没有出现任何口音相似度问题。在语音测试中,创作者以 3:1 的比例选择 Fish Audio,而非替代方案。

如今,Fish Audio 为 HeyGen 全球创作者的语音体验提供支持,让每个声音无论使用何种语言,都能鲜明地保留创作者本人的特色。

阅读更多客户故事

Fish Audio

随时为您准备就绪

和我们的团队聊聊你的部署计划。我们会带着准备来。