صوت شخصية ذكاء اصطناعي ياباني لـ Picto VOICE.
كيف تدمج Pictoria منصة Fish Audio في Picto VOICE، وهو مكدسها الداخلي متعدد المورّدين، لتوفير تعبير بمستوى الشخصية في إنتاجات شخصيات الذكاء الاصطناعي اليابانية.
كيف تدمج Pictoria منصة Fish Audio في Picto VOICE، وهو مكدسها الداخلي متعدد المورّدين، لتوفير تعبير بمستوى الشخصية في إنتاجات شخصيات الذكاء الاصطناعي اليابانية.
عبر ساعات من محتوى الشخصيات الطويل: موثوقية صوت بلا انجراف مطلوبة للحفاظ على الإيهام في عوالم شخصيات الذكاء الاصطناعي اليابانية.
Hayato Akedo
الرئيس التنفيذي في Pictoria
"تواصل Fish Audio دفع حدود توليد الصوت عالي الجودة الذي يتوقعه السوق الياباني. نؤمن بأن الأصوات التي تحمل هذا المستوى من الدقة العاطفية وتعبير الشخصيات لا يمكن أن يصنعها إلا فريق يحب بصدق المحتوى القائم على الشخصيات. شكرا لكم على بناء تقنية TTS استثنائية بهذا المستوى."
كبير علماء Fish Audio
Shijia Liao

"شخصيات الذكاء الاصطناعي اليابانية هي حالة الاستخدام التي تطلب أكثر ما يمكن من نموذج صوتي. دقة النطق وحدها لا تكفي. يجب أن يحمل الصوت الشخصية: السجل العاطفي المحدد، لحظة التوقف، والدفء الذي يجعل الشخص يبدو كإنسان حقيقي لا مجرد صوت يشبه الإنسان. تضع Pictoria هذا المعيار أعلى من أي فريق تقريبا نعمل معه، والمشاركة في Picto VOICE تدفع نموذجنا إلى الأمام مع كل إصدار."

Pictoria هي شركة يابانية لشخصيات AI تبني مشاريع شخصيات AI بمواهب صوتية، وتطور أيضًا حقوق IP أصلية لشخصيات AI داخل الشركة. في مركز كل إنتاج من Pictoria توجد Picto VOICE — وهي منظومة صوت داخلية تجمع عدة تقنيات TTS يابانية وتختار الأنسب لكل شخصية.
الصوت ليس ميزة في تجربة شخصية AI. بالنسبة إلى Pictoria، الصوت هو تجربة شخصية AI نفسها.
تضع أصوات الشخصيات اليابانية بالذكاء الاصطناعي معيارا لا تستطيع معظم نماذج تحويل النص إلى كلام تجاوزه. فطبيعية الصوت ودقة النطق أساس فقط؛ أما العوامل الحاسمة فهي التعبير العاطفي داخل الجملة الواحدة، والإيقاع الياباني ونبرة اللكنة بدقة، واتساق الصوت عبر محتوى الشخصيات الطويل.
قد تنجح قراءات TTS العامة في اختبارات القياس، لكنها تكسر الإحساس بالتصديق الذي تعتمد عليه تجارب الشخصيات بالذكاء الاصطناعي. بالنسبة إلى Pictoria، كانت الفجوتان المستمرتان في أنظمة TTS اليابانية المتاحة لشخصيات الذكاء الاصطناعي هما التعبير العاطفي والإيقاع الياباني الطبيعي على مستوى الشخصية — وهما عنصران أساسيان لمحفظة الشركة المتنامية من ملكيات شخصيات الذكاء الاصطناعي الأصلية.

بدلا من إسناد كامل مساحة صوت الشخصيات إلى مزود واحد، بنت Pictoria نظام Picto VOICE كطبقة تنسيق داخلية تدمج عدة تقنيات يابانية للصوت بالذكاء الاصطناعي. يختار كلّ شخصية وكلّ استخدام مكوّن توليد الصوت المناسب من هذه الحزمة.
تحمي هذه البنية Pictoria من الارتباط بمورّد واحد، وتتيح للفريق تقييم نماذج صوت يابانية جديدة باستمرار، وتضمن أن تكون أفضل تقنية — لتلك الشخصية، وذلك المشهد، وذلك السجل العاطفي — هي المستخدمة دائما في الإنتاج. حصل Fish Audio على مكان في Picto VOICE إلى جانب تقنيات الصوت الأخرى التي يدمجها الفريق.
قيّمت Pictoria تقنية Fish Audio كواحدة من عدة تقنيات لتوليد الصوت قيد الدراسة من أجل Picto VOICE. جذبت الفريق ثلاثة أشياء:
مدى تعبيري لأصوات بأسلوب الشخصيات — وخصوصا القدرة على حمل الفروق العاطفية الدقيقة داخل جملة واحدة. هذه هي النقلة التي تفصل صوت الشخصية عن صوت الراوي.
جودة TTS يابانية معبّرة على مستوى الإيقاع والتنغيم، وليس فقط دقة الفونيمات.
مرونة في تصميم صوت الشخصية — القدرة على تشكيل أصوات تناسب موجزا محددا للشخصية بدلا من الاختيار من مكتبة ثابتة.
ما برز بجانب النموذج نفسه هو سرعة استجابة فريق Fish Audio لاحتياجات أصوات الشخصيات اليابانية بالذكاء الاصطناعي — وهو نوع من الشراكة يحوّل علاقة المورّد إلى تعاون عملي مع فريق البحث وراء النموذج.

داخل Picto VOICE، يُستخدم Fish Audio خصوصا في حالات شخصيات الذكاء الاصطناعي التي تكون فيها التعبيرية القوية على مستوى الشخصية هي العامل الحاسم. ومن أمثلة النشر البارزة خط إنتاج أصوات Pictoria لشخصياتها الأصلية بالذكاء الاصطناعي — وهي ملكيات داخلية تطورها الشركة وتديرها عبر قنوات النشر الخاصة بها.
أدى دمج Fish Audio في Picto VOICE إلى أثر قوي واستقبال إيجابي عبر مشاريع شخصيات الذكاء الاصطناعي هذه.
كان استقبال المستخدمين لأصوات الشخصيات اليابانية بالذكاء الاصطناعي المنتجة عبر Picto VOICE إيجابيا ضمن ثلاثة محاور ثابتة:
المنتجات المستخدمة: Fish Audio S2 Pro · Text-to-Speech
تحسينات ملموسة في سرعة الاستجابة اليابانية والتعبير العاطفي داخل Picto VOICE.
استقبال إيجابي قوي عبر ملكيات Pictoria الأصلية لشخصيات الذكاء الاصطناعي.
تعاون نشط على حدود أصوات الشخصيات اليابانية؛ تبقى المقاييس الكمية سرية بموجب اتفاقيات الملكية الفكرية.
هناك ثلاثة أشياء تميز TTS للشخصيات اليابانية عن TTS الياباني العام: التعبير العاطفي داخل الجملة الواحدة، والإيقاع الياباني ونبرة الارتفاع بدقة بدلًا من دقة الفونيمات فقط، واتساق الصوت عبر محتوى الشخصية الطويل. يختار Picto VOICE من Pictoria تقنيات الصوت لكل شخصية بناءً على هذه المعايير، وقد حجز Fish Audio مكانه بفضل التعبير على مستوى الشخصية.
تحدث إلى فريقنا حول أصوات الشخصيات، والتحكم في النبر والتنغيم، والتكامل مع حزم متعددة المورّدين مثل Picto VOICE. سنأتي مستعدين.