当声音不再是美式英语时,会发生什么?
HeyGen 的创作者遍布全球。澳大利亚、印度、英国、南非、新加坡、爱尔兰、苏格兰、菲律宾和加勒比地区的创作者都说英语,但各有自己的口音。
HeyGen 原先在生产环境中使用的文本转语音方案能准确生成美式英语,却把其他口音也拉向同一个方向。韵律变得平淡,元音失去特色,让观众熟悉的创作者口音变成了近似中性美式口音。市场上的大部分模型都有这个问题:以美式英语为基础训练、再适配其他口音的模型,通常擅长美式英语,却会在其他口音上出现可预见的退化。
支持工单中最常见的声音问题
创作者立刻注意到了问题。口音相似度成为反复出现的投诉:他们的声音听起来不再像自己。更重要的是,问题恰好集中在 HeyGen 希望拓展的用户群体。全球创作者需要让声音跨越语言和口音,同时保留让人能够辨认出自己的独特身份。
HeyGen 用一个问题检验整个市场
这次评估并非功能对比。HeyGen 没有寻找延迟最低、表现力最强或支持语言最多的模型,而是将评估归结为一个更简单的问题:创作者克隆自己的声音后,听起来还像本人吗?
具体而言,HeyGen 测试模型能否保留让声音具有辨识度的口音。英国创作者能否保留自己的英国口音?声音能否在不同语言之间切换,而不会默认变成美式版本的自己?
这成为了评判标准。声音可以快速、富有表现力,技术上也很出色,但只要口音变了,就无法通过测试。
Fish 是一个非常出色的语音模型,能够最大化非常独特声音的相似度。

John Wu
HeyGen 音频工程经理
相似度胜过延迟与成本
HeyGen 选择 Fish Audio,是因为它最符合这一标准。速度和价格固然重要,却都不是决定因素。一旦模型达到了性能门槛,关键区别就很简单:哪一个能在不同口音下最忠实地还原声音?
Fish Audio 的优势在于保留原始声音的特征,而不是将其调整为统一的基准。这种一致性让 HeyGen 能将语音产品拓展至更多创作者和市场,而无需让创作者妥协于自己的声音。
结果不只是获得了更好的语音模型。它消除了 HeyGen 跨语言使用的一大障碍,也为公司的全球创作者战略奠定了更坚实的基础。
从第一周起就承载全部生产流量
HeyGen 通过 Fish Audio 云端 API 部署了 S2 Pro。创作者发布的每条使用 Fish 驱动声音的视频都由该模型处理。无需分阶段上线或试点用户群,集成立即进入生产规模。
成果:声音始终保有自我
迁移至 Fish Audio 后,HeyGen 在生产环境中没有出现任何口音相似度问题。在语音测试中,创作者以 3:1 的比例选择 Fish Audio,而非替代方案。
如今,Fish Audio 为 HeyGen 全球创作者的语音体验提供支持,让每个声音无论使用何种语言,都能鲜明地保留创作者本人的特色。