声がアメリカ英語から離れると何が起きるか
HeyGen のクリエイター層はグローバルです。オーストラリア、インド、イギリス、南アフリカ、シンガポール、アイルランド、スコットランド、フィリピン、カリブ地域—皆が同じ英語を話していても、その響きやアクセントは一人ひとり全く異なります。
HeyGenが 従来採用していた TTS レイヤーは、アメリカ英語の再現性に優れる一方、他地域のアクセントを強引にアメリカ英語へ寄せる傾向がありました。その結果、抑揚は平坦化し母音も中和され、クリエイター固有の声の個性が失われていたのです。この事象には明確な理由があります。アメリカ英語を優先学習し事後的に他言語へ対応させたモデルは、標準アメリカ英語以外では一貫して処理性能が低下する構造的課題を抱えているためです。
サポートに最も多く届いた声
クリエイターはすぐに変化へ気づきました。「自分の声らしく聞こえない」と、アクセントの再現性に対する不満が相次いだのです。さらに深刻なことに、この問題は HeyGen がまさに成長を図っていた中核層に集中していました。グローバルなクリエイターにとって、自身の声のアイデンティティを失わずに言語やアクセントの壁を越えることは不可欠だったのです。
HeyGen が市場に突きつけた、たった一つの問い
評価は単なる機能比較ではありませんでした。HeyGen が求めたのは、レイテンシーの短さでも、表現力の豊かさでも、対応言語の多さでもありません。評価軸はもっとシンプルでした。「クリエイターが声をクローンしたとき、そこに『自分らしさ』が残っているか」—それだけだったのです。
具体的には、その人らしさを決める元のアクセントをモデルが保持できるかを検証しました。イギリス人クリエイターはイギリス英語のアクセントを保てるのか。そして、言語を切り替えても声がアメリカ風へ均一化されずにいられるか、という点です。
それが妥協のない基準となりました。どれほど高速で表現力豊かな技術であっても、アクセントが変わってしまえば、その声はテスト不合格となったのです。
Fish は、非常に個性的な声であっても類似度を極限まで高めることができる、素晴らしい音声モデルです。

John Wu
HeyGen 音声エンジニアリングマネージャー
遅延やコストよりも『声の再現性』を最優先
HeyGen が Fish Audio を選んだのは、この評価基準に最も適していたからです。速度やコストも重要ですが決定打ではありません。性能基準を越えた後の真の差別化要素は、多様なアクセントでどちらが最も忠実に声を再現できるかという一点でした。
Fish Audio は元の声を標準的な音質へ均すことなく、その固有の特徴を保持する点で際立っていました。この一貫性こそが、HeyGen がクリエイターに声の個性を妥協させることなく、新たな市場や多様なユーザー層へ音声機能を拡大できた鍵です。
この取り組みは、単なる音声モデルの刷新を超えた成果を生みました。多言語展開における障壁を解消し、HeyGen のグローバルなクリエイター戦略を支えるより強固な盤石の基盤が構築されたのです。
運用初週から本番環境の全トラフィックに対応
HeyGen は Fish Audio のクラウド API を経由して S2 Pro をデプロイしました。Fish 採用の音声で生成される動画は、すべてこのモデルを通じて処理されます。段階的なロールアウトやスモール検証は不要で、連携直後から本番規模での即時フル稼働が実現しました。
成果:自分らしさを保つ声
Fish Audio への移行以来、本番環境でのアクセント不一致トラブルはゼロを達成。ブラインドテストでも、クリエイターは競合モデルに対し 3 対 1 という圧倒的優位で Fish Audio を選出しました。
現在、Fish Audio は HeyGen のグローバル発信を支えています。どんな場所や言語であっても、紛れもなく本人の声として届く音声体験を実現しています。