Reverie AI создаёт развлечения, реагирующие на пользователя
Традиционные развлечения следуют фиксированной последовательности: сценарий написан, исполнение записано, каждый зритель видит одно и то же.
Reverie AI создаёт другой подход. Модели принимают текст, голос, видео, касания, жесты, выбор и действия на экране, а затем определяют дальнейшие события. Пользователь может заговорить с персонажем, повлиять на сцену, изменить финал или открыть ветку, которой мгновение назад не было.
Это значит, что опыт больше не определён полностью до появления пользователя. Персонажи и сцены должны реагировать на происходящее в моменте.
Отзывчивый мир не может ждать озвучки
В фиксированном контенте речь можно записать после завершения сценария. В интерактивном мире следующая реплика может появиться только после действия пользователя.
Reverie требовалась речь, начинающаяся до завершения генерации всего ответа, следующая указаниям внутри реплики и сохраняющая персонажа между сценами и ветками. Стоимость тоже должна оставаться приемлемой, когда каждое взаимодействие создаёт новую речь.
Целью было не просто человеческое звучание, а голос, действующий как часть живого мира.
Reverie AI хотела управлять персонажем, а не выбирать готовое голосовое поведение
Reverie оценивала четыре требования: быстрый стриминг, управление выразительностью, постоянство персонажа и многоязычность. Команде нужно было направлять персонажа в моменте, а не задавать одно настроение всему ответу.
Fish Audio объединила эти возможности в одной голосовой основе. Речь передаётся через WebSocket по мере генерации, выражением можно управлять прямо в тексте на естественном языке, а повторно используемые модели сохраняют голосовую идентичность на протяжении опыта.
Fish Audio позволяет персонажам отвечать сразу
С Fish Audio Reverie начинает передачу речи до завершения всего ответа. Это сокращает промежуток между действием пользователя и реакцией персонажа, делая взаимодействие непрерывным.
Команда управляет отдельными моментами реплики с помощью подсказок для шёпота, смеха или восторга. Вместо одной настройки на всю сцену Reverie подстраивает исполнение под происходящее.
Повторно используемые голосовые модели сохраняют узнаваемость персонажей между сценами, сеансами и ветками событий.
Единая голосовая основа для миров без границ
Опыт Reverie рассчитан на глобальную аудиторию, поэтому голос должен работать на разных языках без отдельного производственного процесса для каждого рынка.
Текущая рабочая модель Fish Audio поддерживает 83 языка, позволяя выводить персонажей на новые рынки и сохранять ту же голосовую архитектуру.
Важна и экономика. API Fish Audio с оплатой по использованию стоит 15 долларов за миллион байт UTF-8, позволяя масштабировать инфраструктуру вместе с ростом речи, создаваемой новыми взаимодействиями.
Голос становится частью мира
Для Reverie это переход от воспроизведения голоса к его участию.
Персонажи реагируют сразу вместо чтения записанных реплик. Их голоса меняются вместе со сценой, сохраняя узнаваемость. Одна инфраструктура поддерживает разные форматы: от ролевых компаньонов и виртуальных питомцев до интерактивных приключений и игр.
Fish Audio дала Reverie голосовую основу для отзывчивых впечатлений, не превращая производство речи в отдельный процесс.