Reverie AI

Reverie AI 携手 Fish Audio,打造能与你对话的娱乐体验

Reverie AI 构建实时交互模型,将视频变成能够响应用户的世界。其 AI 能理解用户说的话、做出的选择、点击和动作,并据此改变体验。 对 Reverie 而言,这意味着角色不能依赖预先录制的台词。Fish Audio 提供语音支持,在世界响应用户时流式输出语音,让 Reverie 掌控角色如何说话、如何反应,以及如何在体验的各条分支中保持鲜明的身份。

使用的产品
Fish Audio S2 Pro文本转语音流式 API

Reverie AI 打造能够响应用户的娱乐体验

传统娱乐遵循固定的时间线:写好剧本、录好表演,每位观众看到的都是同一段内容。

Reverie AI 正在构建不同的体验。其交互模型可以接收文本、语音、视频、触摸、手势、选择和屏幕操作,再决定接下来发生什么。用户可以与角色交谈、影响场景、改变结局,或开启前一刻尚不存在的分支。

这意味着体验不再在用户进入之前就被完全定义。角色和场景必须回应当下发生的事情。

能够响应的世界不能等待配音

对于固定内容,可以在剧本完成后录制语音。而在交互世界中,下一句台词可能要等用户采取行动后才会产生。

Reverie 需要在完整回复生成完毕前就开始说话的声音,能够在一句台词内部接受指令,并在不同场景和分支中保持角色一致。当每次交互都可能生成新语音时,成本也必须可行。

目标不只是让生成的声音听起来像人,而是让语音成为一个实时运转的世界的一部分。

Reverie AI 希望掌控角色,而非选择预设的语音体验

Reverie 从四个方面评估语音供应商:快速流式输出、表现力控制、持久的角色身份和多语言支持。团队需要即时指导角色,而不是为整段回复选择一种情绪。

Fish Audio 在同一套语音能力中满足了这些需求。语音在生成时通过 WebSocket 流式传输,可在文本中用自然语言指导表达,可复用的声音模型则让角色在整个体验中保持一致的声音身份。

Fish Audio 让角色即时回应

借助 Fish Audio,Reverie 可以在完整回复生成完毕前开始流式输出语音。这缩短了用户行动与角色反应之间的间隔,让交互显得连贯。

团队可以控制一句台词中的具体时刻,用提示指导低语、笑声或兴奋等表达。Reverie 不必为整个场景统一应用一种声音设置,而是能围绕正在发生的事情塑造表演。

可复用的声音模型让角色在不同场景、会话和分支间仍然易于辨认。

一套语音能力,支持走向全球的世界

Reverie 的体验面向全球受众,因此语音需要跨语言工作,而无需为每个市场另建制作流程。

Fish Audio 当前生产模型支持 83 种语言,让 Reverie 能将角色带入新市场,同时将语音保留在同一架构中。

成本同样重要。Fish Audio 按量计费的 API 定价为每百万 UTF-8 字节 15 美元,让 Reverie 的语音基础设施能随着交互产生的语音用量一起扩展。

声音成为世界的一部分

对 Reverie 来说,这一转变是从播放声音走向让声音参与其中。

角色可以即时作出反应,而非播放预录台词。声音可以随场景变化,同时保持可辨认的身份。同一套语音基础设施能够支持 Reverie 正在构建的不同形式,从角色扮演伙伴、虚拟宠物,到交互式冒险和游戏。

Fish Audio 为 Reverie 提供语音基础,让这些体验具备响应能力,而无需将语音制作变成独立流程。

阅读更多客户故事

Fish Audio

随时为您准备就绪

和我们的团队聊聊你的部署计划。我们会带着准备来。