Reverie AI cria entretenimento que responde ao usuário
O entretenimento tradicional segue uma sequência fixa. O roteiro é escrito, a atuação é gravada e todos os espectadores veem a mesma sequência.
Reverie AI está criando algo diferente. Seus modelos recebem texto, voz, vídeo, toque, gestos, escolhas e ações na tela para decidir o que acontece depois. O usuário pode conversar com um personagem, influenciar uma cena, mudar um final ou abrir uma ramificação que não existia antes.
Assim, a experiência deixa de estar totalmente definida antes da entrada do usuário. Personagens e cenas precisam responder ao que acontece naquele momento.
Um mundo responsivo não pode esperar pela dublagem
Em um conteúdo fixo, a voz pode ser gravada depois que o roteiro estiver pronto. Em um mundo interativo, a próxima fala talvez só exista quando o usuário fizer algo.
A Reverie precisava de voz que começasse antes de concluir a geração da resposta, seguisse instruções dentro de uma fala e mantivesse o mesmo personagem entre cenas e ramificações. O custo também precisava ser viável quando cada interação pudesse gerar novas falas.
O objetivo não era apenas fazer uma voz gerada soar humana, mas fazê-la funcionar como parte de um mundo vivo.
Reverie AI queria controlar o personagem, não uma experiência vocal pronta
A Reverie avaliou quatro requisitos: streaming rápido, controle expressivo, identidade persistente do personagem e suporte multilíngue. A equipe precisava dirigir o personagem a cada momento, em vez de escolher uma emoção para toda a resposta.
A Fish Audio reuniu essas capacidades em uma base de voz. A fala é transmitida por WebSocket enquanto é gerada, a expressão pode ser orientada no texto em linguagem natural e modelos reutilizáveis mantêm a identidade vocal ao longo da experiência.
Fish Audio permite que personagens respondam no momento
Com a Fish Audio, a Reverie começa a transmitir fala antes de terminar a resposta completa. Isso encurta o intervalo entre a ação do usuário e a reação do personagem, tornando a interação contínua.
A equipe dirige momentos específicos de uma fala com indicações de sussurro, riso ou entusiasmo. Em vez de aplicar uma única configuração vocal a toda a cena, adapta a interpretação ao que está acontecendo.
Modelos de voz reutilizáveis mantêm os personagens reconhecíveis entre cenas, sessões e ramificações.
Uma base de voz para mundos que podem chegar a qualquer lugar
As experiências da Reverie foram projetadas para públicos globais, então a voz precisa funcionar em vários idiomas sem criar um processo de produção separado para cada mercado.
O modelo de produção atual da Fish Audio suporta 83 idiomas, permitindo levar os personagens a novos mercados mantendo a voz na mesma arquitetura.
A economia também importa. A API de pagamento por uso da Fish Audio custa 15 dólares por milhão de bytes UTF-8, permitindo ampliar a infraestrutura conforme mais interações geram fala.
A voz passa a fazer parte do mundo
Para a Reverie, a mudança é sair da voz como reprodução para a voz como participação.
Os personagens reagem no momento em vez de recitar falas gravadas. Suas vozes mudam com a cena sem perder a identidade. A mesma infraestrutura atende a diferentes formatos, de companheiros de interpretação de papéis e animais virtuais a aventuras interativas e jogos.
A Fish Audio deu à Reverie a base de voz para tornar essas experiências responsivas sem transformar a produção vocal em um processo separado.