Reverie AI 打造能够响应用户的娱乐体验
传统娱乐遵循固定的时间线:写好剧本、录好表演,每位观众看到的都是同一段内容。
Reverie AI 正在构建不同的体验。其交互模型可以接收文本、语音、视频、触摸、手势、选择和屏幕操作,再决定接下来发生什么。用户可以与角色交谈、影响场景、改变结局,或开启前一刻尚不存在的分支。
这意味着体验不再在用户进入之前就被完全定义。角色和场景必须回应当下发生的事情。
能够响应的世界不能等待配音
对于固定内容,可以在剧本完成后录制语音。而在交互世界中,下一句台词可能要等用户采取行动后才会产生。
Reverie 需要在完整回复生成完毕前就开始说话的声音,能够在一句台词内部接受指令,并在不同场景和分支中保持角色一致。当每次交互都可能生成新语音时,成本也必须可行。
目标不只是让生成的声音听起来像人,而是让语音成为一个实时运转的世界的一部分。
Reverie AI 希望掌控角色,而非选择预设的语音体验
Reverie 从四个方面评估语音供应商:快速流式输出、表现力控制、持久的角色身份和多语言支持。团队需要即时指导角色,而不是为整段回复选择一种情绪。
Fish Audio 在同一套语音能力中满足了这些需求。语音在生成时通过 WebSocket 流式传输,可在文本中用自然语言指导表达,可复用的声音模型则让角色在整个体验中保持一致的声音身份。
Fish Audio 让角色即时回应
借助 Fish Audio,Reverie 可以在完整回复生成完毕前开始流式输出语音。这缩短了用户行动与角色反应之间的间隔,让交互显得连贯。
团队可以控制一句台词中的具体时刻,用提示指导低语、笑声或兴奋等表达。Reverie 不必为整个场景统一应用一种声音设置,而是能围绕正在发生的事情塑造表演。
可复用的声音模型让角色在不同场景、会话和分支间仍然易于辨认。
一套语音能力,支持走向全球的世界
Reverie 的体验面向全球受众,因此语音需要跨语言工作,而无需为每个市场另建制作流程。
Fish Audio 当前生产模型支持 83 种语言,让 Reverie 能将角色带入新市场,同时将语音保留在同一架构中。
成本同样重要。Fish Audio 按量计费的 API 定价为每百万 UTF-8 字节 15 美元,让 Reverie 的语音基础设施能随着交互产生的语音用量一起扩展。
声音成为世界的一部分
对 Reverie 来说,这一转变是从播放声音走向让声音参与其中。
角色可以即时作出反应,而非播放预录台词。声音可以随场景变化,同时保持可辨认的身份。同一套语音基础设施能够支持 Reverie 正在构建的不同形式,从角色扮演伙伴、虚拟宠物,到交互式冒险和游戏。
Fish Audio 为 Reverie 提供语音基础,让这些体验具备响应能力,而无需将语音制作变成独立流程。