Reverie AI

تبني Reverie AI تجارب ترفيهية تتحدث معك باستخدام Fish Audio

تطوّر Reverie AI نماذج تفاعل في الوقت الفعلي تحوّل الفيديو إلى عوالم تستجيب للمستخدمين. يستطيع ذكاؤها الاصطناعي فهم ما يقولونه أو يختارونه أو ينقرون عليه أو يفعلونه، ثم تغيير التجربة استجابةً لذلك. وهذا يعني أن الشخصيات لا يمكنها الاعتماد على حوار مسجّل مسبقًا. توفّر Fish Audio الصوت عبر البث أثناء استجابة العالم، وتمنح Reverie التحكم في طريقة كلام الشخصيات وردودها والحفاظ على هويتها في كل مسار من التجربة.

المنتجات المستخدمة
Fish Audio S2 Proتحويل النص إلى كلامواجهة API للبث

تبني Reverie AI ترفيهًا يستجيب للمستخدم

يتبع الترفيه التقليدي تسلسلًا زمنيًا ثابتًا: يُكتب السيناريو ويُسجّل الأداء ويرى كل مشاهد التسلسل نفسه.

تبني Reverie AI شيئًا مختلفًا. تستقبل نماذجها النص والصوت والفيديو واللمس والإيماءات والاختيارات والأفعال على الشاشة لتحديد ما يحدث لاحقًا. يمكن للمستخدم التحدث إلى شخصية، أو التأثير في مشهد، أو تغيير نهاية، أو فتح مسار لم يكن موجودًا قبل لحظة.

وهذا يعني أن التجربة لم تعد محدّدة بالكامل قبل دخول المستخدم. يجب أن تستجيب الشخصيات والمشاهد لما يحدث في اللحظة نفسها.

العالم المتجاوب لا يستطيع انتظار التعليق الصوتي

في المحتوى الثابت، يمكن تسجيل الصوت بعد اكتمال السيناريو. أما في العالم التفاعلي، فقد لا توجد الجملة التالية حتى يقوم المستخدم بفعل ما.

احتاجت Reverie إلى صوت يبدأ قبل اكتمال توليد الرد، ويتبع التوجيهات داخل الجملة، ويحافظ على الشخصية نفسها عبر المشاهد والمسارات. وكان يجب أن تبقى التكلفة مناسبة حين يمكن لكل تفاعل أن يولّد كلامًا جديدًا.

لم يكن الهدف مجرد جعل الصوت المولّد يبدو بشريًا، بل جعله يتصرف كجزء من عالم حي.

أرادت Reverie AI التحكم في الشخصية، لا تجربة صوتية جاهزة

قيّمت Reverie المزوّدين وفق أربعة متطلبات: بث سريع، وتحكم في التعبير، وهوية ثابتة للشخصية، ودعم متعدد اللغات. احتاج الفريق إلى توجيه الشخصية في اللحظة بدل اختيار شعور واحد للرد بأكمله.

لبّت Fish Audio هذه المتطلبات ضمن أساس صوتي واحد. يُبث الكلام عبر WebSocket أثناء توليده، ويمكن توجيه التعبير داخل النص بلغة طبيعية، وتحافظ النماذج القابلة لإعادة الاستخدام على هوية صوتية متسقة طوال التجربة.

تتيح Fish Audio للشخصيات الاستجابة فورًا

مع Fish Audio، تبدأ Reverie بث الكلام قبل اكتمال توليد الرد. وهذا يقلّص الفترة بين فعل المستخدم ورد الشخصية، ليبدو التفاعل متواصلًا.

يستطيع الفريق توجيه لحظات محدّدة داخل الجملة باستخدام إشارات للهمس أو الضحك أو الحماس. وبدل تطبيق إعداد صوتي واحد على مشهد كامل، تشكّل Reverie الأداء وفق ما يحدث.

تحافظ النماذج الصوتية القابلة لإعادة الاستخدام على تميّز الشخصيات عبر المشاهد والجلسات والمسارات.

أساس صوتي واحد لعوالم تصل إلى كل مكان

صُمّمت تجارب Reverie لجمهور عالمي، لذا يجب أن يعمل الصوت عبر اللغات دون إنشاء مسار إنتاج منفصل لكل سوق.

يدعم نموذج الإنتاج الحالي من Fish Audio عددًا قدره 83 لغة، ما يتيح نقل الشخصيات إلى أسواق جديدة مع إبقاء الصوت ضمن البنية نفسها.

والتكلفة مهمة أيضًا. تبلغ تكلفة واجهة Fish Audio المدفوعة حسب الاستخدام 15 دولارًا لكل مليون بايت UTF-8، لتوفير بنية تتوسّع مع الاستخدام كلما ولّدت التفاعلات مزيدًا من الكلام.

يصبح الصوت جزءًا من العالم

بالنسبة إلى Reverie، يمثّل ذلك انتقالًا من تشغيل الصوت إلى مشاركته في التجربة.

تستجيب الشخصيات في اللحظة بدل إلقاء جمل مسجّلة. وتتغيّر أصواتها مع المشهد مع الحفاظ على هوية يمكن تمييزها. وتدعم البنية نفسها صيغًا متنوعة، من رفقاء لعب الأدوار والحيوانات الافتراضية إلى المغامرات التفاعلية والألعاب.

منحت Fish Audio شركة Reverie الأساس الصوتي لجعل هذه التجارب متجاوبة دون تحويل إنتاج الصوت إلى مسار منفصل.

اقرأ المزيد من قصص العملاء

Fish Audio

جاهزون عندما تكون مستعدًا

تحدث مع فريقنا عن النشر الخاص بك. سنأتي مستعدين.