Reverie AI는 사용자에게 반응하는 엔터테인먼트를 만듭니다
전통적인 엔터테인먼트는 고정된 시간 흐름을 따릅니다. 대본을 쓰고 연기를 녹화하면 모든 시청자가 같은 순서를 봅니다.
Reverie AI는 다른 경험을 만들고 있습니다. 상호작용 모델은 텍스트, 음성, 영상, 터치, 제스처, 선택, 화면 조작을 받아 다음 전개를 결정합니다. 사용자는 캐릭터와 대화하고, 장면에 영향을 주고, 결말을 바꾸거나 방금 전까지 없던 분기를 열 수 있습니다.
따라서 사용자가 들어오기 전에 경험 전체가 정해지지 않습니다. 캐릭터와 장면은 그 순간 벌어지는 일에 반응해야 합니다.
반응하는 세계는 더빙을 기다릴 수 없습니다
고정된 콘텐츠에서는 대본을 완성한 뒤 음성을 녹음할 수 있습니다. 상호작용하는 세계에서는 사용자가 행동하기 전까지 다음 대사가 존재하지 않을 수도 있습니다.
Reverie에는 전체 응답 생성이 끝나기 전에 말하기 시작하고, 한 대사 안에서도 지시를 따르며, 장면과 분기를 넘어 같은 캐릭터를 유지하는 음성이 필요했습니다. 모든 상호작용에서 새 음성이 생겨도 비용이 감당 가능해야 했습니다.
목표는 생성 음성을 사람처럼 들리게 하는 데 그치지 않고, 살아 있는 세계의 일부처럼 작동하게 하는 것이었습니다.
Reverie AI가 원한 것은 완성된 음성 경험보다 캐릭터에 대한 제어였습니다
Reverie는 빠른 스트리밍, 표현력 제어, 지속적인 캐릭터 정체성, 다국어 지원이라는 네 가지 기준으로 공급업체를 평가했습니다. 응답 전체에 하나의 감정을 고르는 대신 매 순간 캐릭터를 연출해야 했습니다.
Fish Audio는 하나의 음성 기반에서 이를 충족했습니다. 생성 중인 음성을 WebSocket으로 스트리밍하고, 자연어로 대사 안의 표현을 지시하며, 재사용 가능한 음성 모델로 경험 전반에서 일관된 목소리를 유지합니다.
Fish Audio는 캐릭터가 즉시 반응하도록 합니다
Fish Audio를 통해 Reverie는 전체 응답 생성이 끝나기 전에 음성 스트리밍을 시작합니다. 사용자 행동과 캐릭터 반응 사이의 간격이 짧아져 상호작용이 끊김 없이 느껴집니다.
팀은 속삭임, 웃음, 흥분 같은 단서로 대사 속 개별 순간을 연출할 수 있습니다. 장면 전체에 하나의 음성 설정을 적용하는 대신 현재 벌어지는 일에 맞춰 연기를 구성합니다.
재사용 가능한 음성 모델은 장면, 세션, 분기가 바뀌어도 캐릭터를 알아볼 수 있게 해 줍니다.
어디로든 확장되는 세계를 위한 하나의 음성 기반
Reverie의 경험은 전 세계 사용자를 대상으로 하므로, 시장마다 별도의 제작 파이프라인 없이 여러 언어에서 음성이 작동해야 합니다.
Fish Audio의 현재 프로덕션 모델은 83개 언어를 지원해, 같은 음성 아키텍처를 유지하면서 캐릭터를 새 시장으로 확장할 수 있습니다.
경제성도 중요합니다. Fish Audio의 종량제 API는 UTF-8 100만 바이트당 15달러로, 상호작용과 음성 생성이 늘어날 때 사용량에 맞춰 확장할 수 있는 기반을 제공합니다.
목소리가 세계의 일부가 됩니다
Reverie에게 이는 목소리를 재생하는 것에서 목소리가 참여하는 것으로의 전환입니다.
캐릭터는 녹음된 대사를 전달하는 대신 즉시 반응합니다. 장면에 따라 목소리가 바뀌어도 알아볼 수 있는 정체성을 유지합니다. 같은 음성 인프라가 역할극 동반자와 가상 반려동물부터 상호작용형 모험과 게임까지 다양한 형식을 지원합니다.
Fish Audio는 음성 제작을 별도 과정으로 분리하지 않고도 이러한 경험이 반응하도록 만드는 음성 기반을 Reverie에 제공했습니다.