Reverie AI crea entretenimiento que responde al usuario
El entretenimiento tradicional sigue una secuencia fija. Se escribe el guion, se graba la actuación y todos los espectadores ven lo mismo.
Reverie AI construye algo distinto. Sus modelos reciben texto, voz, vídeo, toques, gestos, decisiones y acciones en pantalla para determinar qué ocurre después. El usuario puede hablar con un personaje, influir en una escena, cambiar un final o abrir una ramificación que antes no existía.
Así, la experiencia ya no está totalmente definida antes de que entre el usuario. Los personajes y las escenas deben responder a lo que sucede en cada momento.
Un mundo que responde no puede esperar al doblaje
En un contenido fijo, la voz puede grabarse cuando termina el guion. En un mundo interactivo, la siguiente frase quizá no exista hasta que el usuario haga algo.
Reverie necesitaba una voz que empezara antes de terminar de generar la respuesta, siguiera indicaciones dentro de una frase y mantuviera al personaje entre escenas y ramificaciones. También debía ser económicamente viable si cada interacción generaba nuevo diálogo.
El objetivo no era solo que la voz generada sonara humana, sino que actuara como parte de un mundo vivo.
Reverie AI quería controlar al personaje, no elegir una experiencia vocal cerrada
Reverie evaluó cuatro requisitos: streaming rápido, control expresivo, identidad persistente del personaje y soporte multilingüe. El equipo necesitaba dirigir al personaje en cada momento, en lugar de elegir una sola emoción para toda la respuesta.
Fish Audio reunió todo en una misma base de voz. El habla se transmite por WebSocket mientras se genera, la expresión se dirige dentro del texto con lenguaje natural y los modelos reutilizables mantienen una identidad vocal coherente durante la experiencia.
Fish Audio permite que los personajes respondan al instante
Con Fish Audio, Reverie empieza a transmitir voz antes de que termine de generarse la respuesta completa. Así reduce el intervalo entre la acción del usuario y la reacción del personaje para que la interacción se sienta continua.
El equipo dirige momentos concretos de una frase con indicaciones de susurros, risas o entusiasmo. En vez de aplicar un único ajuste vocal a toda una escena, adapta la interpretación a lo que sucede.
Los modelos de voz reutilizables mantienen a los personajes reconocibles entre escenas, sesiones y ramificaciones.
Una base de voz para mundos que pueden llegar a cualquier lugar
Las experiencias de Reverie se dirigen a públicos globales, por lo que la voz debe funcionar en varios idiomas sin crear un proceso de producción distinto para cada mercado.
El modelo de producción actual de Fish Audio admite 83 idiomas. Reverie puede llevar sus personajes a nuevos mercados manteniendo la voz dentro de la misma arquitectura.
El coste también importa. La API de pago por uso de Fish Audio cuesta 15 dólares por millón de bytes UTF-8 y permite ampliar la infraestructura según el uso cuando más interacciones generan voz.
La voz pasa a formar parte del mundo
Para Reverie, el cambio consiste en pasar de reproducir voz a hacerla participar.
Los personajes reaccionan al instante en vez de recitar frases grabadas. Sus voces cambian con la escena sin perder su identidad. La misma infraestructura admite desde compañeros de rol y mascotas virtuales hasta aventuras interactivas y juegos.
Fish Audio proporcionó a Reverie la base de voz para hacer que estas experiencias respondan sin convertir la producción vocal en un proceso independiente.