تبني Reverie AI ترفيهًا يستجيب للمستخدم
يتبع الترفيه التقليدي تسلسلًا زمنيًا ثابتًا: يُكتب السيناريو ويُسجّل الأداء ويرى كل مشاهد التسلسل نفسه.
تبني Reverie AI شيئًا مختلفًا. تستقبل نماذجها النص والصوت والفيديو واللمس والإيماءات والاختيارات والأفعال على الشاشة لتحديد ما يحدث لاحقًا. يمكن للمستخدم التحدث إلى شخصية، أو التأثير في مشهد، أو تغيير نهاية، أو فتح مسار لم يكن موجودًا قبل لحظة.
وهذا يعني أن التجربة لم تعد محدّدة بالكامل قبل دخول المستخدم. يجب أن تستجيب الشخصيات والمشاهد لما يحدث في اللحظة نفسها.
العالم المتجاوب لا يستطيع انتظار التعليق الصوتي
في المحتوى الثابت، يمكن تسجيل الصوت بعد اكتمال السيناريو. أما في العالم التفاعلي، فقد لا توجد الجملة التالية حتى يقوم المستخدم بفعل ما.
احتاجت Reverie إلى صوت يبدأ قبل اكتمال توليد الرد، ويتبع التوجيهات داخل الجملة، ويحافظ على الشخصية نفسها عبر المشاهد والمسارات. وكان يجب أن تبقى التكلفة مناسبة حين يمكن لكل تفاعل أن يولّد كلامًا جديدًا.
لم يكن الهدف مجرد جعل الصوت المولّد يبدو بشريًا، بل جعله يتصرف كجزء من عالم حي.
أرادت Reverie AI التحكم في الشخصية، لا تجربة صوتية جاهزة
قيّمت Reverie المزوّدين وفق أربعة متطلبات: بث سريع، وتحكم في التعبير، وهوية ثابتة للشخصية، ودعم متعدد اللغات. احتاج الفريق إلى توجيه الشخصية في اللحظة بدل اختيار شعور واحد للرد بأكمله.
لبّت Fish Audio هذه المتطلبات ضمن أساس صوتي واحد. يُبث الكلام عبر WebSocket أثناء توليده، ويمكن توجيه التعبير داخل النص بلغة طبيعية، وتحافظ النماذج القابلة لإعادة الاستخدام على هوية صوتية متسقة طوال التجربة.
تتيح Fish Audio للشخصيات الاستجابة فورًا
مع Fish Audio، تبدأ Reverie بث الكلام قبل اكتمال توليد الرد. وهذا يقلّص الفترة بين فعل المستخدم ورد الشخصية، ليبدو التفاعل متواصلًا.
يستطيع الفريق توجيه لحظات محدّدة داخل الجملة باستخدام إشارات للهمس أو الضحك أو الحماس. وبدل تطبيق إعداد صوتي واحد على مشهد كامل، تشكّل Reverie الأداء وفق ما يحدث.
تحافظ النماذج الصوتية القابلة لإعادة الاستخدام على تميّز الشخصيات عبر المشاهد والجلسات والمسارات.
أساس صوتي واحد لعوالم تصل إلى كل مكان
صُمّمت تجارب Reverie لجمهور عالمي، لذا يجب أن يعمل الصوت عبر اللغات دون إنشاء مسار إنتاج منفصل لكل سوق.
يدعم نموذج الإنتاج الحالي من Fish Audio عددًا قدره 83 لغة، ما يتيح نقل الشخصيات إلى أسواق جديدة مع إبقاء الصوت ضمن البنية نفسها.
والتكلفة مهمة أيضًا. تبلغ تكلفة واجهة Fish Audio المدفوعة حسب الاستخدام 15 دولارًا لكل مليون بايت UTF-8، لتوفير بنية تتوسّع مع الاستخدام كلما ولّدت التفاعلات مزيدًا من الكلام.
يصبح الصوت جزءًا من العالم
بالنسبة إلى Reverie، يمثّل ذلك انتقالًا من تشغيل الصوت إلى مشاركته في التجربة.
تستجيب الشخصيات في اللحظة بدل إلقاء جمل مسجّلة. وتتغيّر أصواتها مع المشهد مع الحفاظ على هوية يمكن تمييزها. وتدعم البنية نفسها صيغًا متنوعة، من رفقاء لعب الأدوار والحيوانات الافتراضية إلى المغامرات التفاعلية والألعاب.
منحت Fish Audio شركة Reverie الأساس الصوتي لجعل هذه التجارب متجاوبة دون تحويل إنتاج الصوت إلى مسار منفصل.