Reverie AI はユーザーに応答するエンターテインメントを作る
従来のエンターテインメントは固定された時間軸に従います。脚本を書き、演技を収録し、すべての視聴者が同じ流れを見ます。
Reverie AI は別の体験を作っています。対話モデルはテキスト、音声、映像、タッチ、ジェスチャー、選択、画面上の操作を受け取り、次の展開を決めます。ユーザーはキャラクターに話しかけ、場面に影響を与え、結末を変え、直前にはなかった分岐を開けます。
つまり、ユーザーが参加する前に体験のすべてが決まっているわけではありません。キャラクターや場面は、その瞬間の出来事に応答する必要があります。
反応する世界は音声の完成を待てない
固定されたコンテンツなら、脚本の完成後に音声を収録できます。対話的な世界では、ユーザーが何かをするまで次の台詞自体が存在しないこともあります。
Reverie は、返答全体の生成前に話し始め、一つの台詞の途中でも指示に従い、場面や分岐を越えて同じキャラクターを保てる声を必要としていました。あらゆる操作で新しい音声が生まれても、費用が成り立つことも重要でした。
目標は生成音声を人間らしくするだけでなく、生きた世界の一部として機能させることでした。
Reverie AI が求めたのは完成済みの音声体験ではなくキャラクターの制御
Reverie は、高速ストリーミング、表現の制御、一貫したキャラクターの個性、多言語対応の四つを基準に音声プロバイダーを評価しました。返答全体に一つの感情を選ぶのではなく、その瞬間ごとにキャラクターを演出する必要がありました。
Fish Audio は一つの音声基盤でこれらを満たしました。生成中の音声を WebSocket で配信し、自然言語で台詞内の表現を指定でき、再利用可能な音声モデルで体験全体を通した声の一貫性を保てます。
Fish Audio がキャラクターの即時応答を可能にする
Fish Audio により、返答全体の生成が終わる前に音声配信を始められます。ユーザーの行動とキャラクターの反応の間隔を短くし、途切れない対話として感じられます。
チームは、ささやき、笑い、興奮などの指示で、台詞の一瞬一瞬を演出できます。場面全体に一つの声の設定を適用するのではなく、出来事に合わせた演技を作れます。
再利用可能な音声モデルは、場面、セッション、分岐を移ってもキャラクターの声を認識できるようにします。
世界へ広がる体験を一つの音声基盤で
Reverie の体験は世界のユーザーに向けて設計されており、市場ごとに別の制作工程を作らずに多言語で音声を提供する必要があります。
Fish Audio の現行本番モデルは 83 言語に対応し、同じ音声アーキテクチャのままキャラクターを新しい市場へ展開できます。
経済性も重要です。Fish Audio の従量課金 API は UTF-8 の 100 万バイトあたり 15 ドル。対話による音声生成が増えても、利用量に合わせて拡張できる基盤を提供します。
声が世界の一部になる
Reverie にとって、これは声を再生することから、声が参加することへの転換です。
キャラクターは録音済みの台詞を流す代わりに、その場で反応できます。場面に合わせて声を変えながら個性を保てます。同じ音声基盤が、ロールプレイの相手や仮想ペットから対話型アドベンチャーやゲームまで、さまざまな形式を支えます。
Fish Audio は音声制作を独立した工程にすることなく、これらの体験を応答可能にする音声基盤を Reverie に提供しました。