ينتهي العرض خلال 47H 59M 59S

نحتفل بعامنا الأول 🎂

خصم 50% على كل شيء.

احصل على العرض

قصص العملاء

استنساخ الصوت لفيديو الذكاء الاصطناعي، 3 إلى 1 مقابل البدائل.

كيف انتقلت HeyGen من ElevenLabs إلى Fish Audio لحل مشاكل تشابه الصوت مع لهجات الإنجليزية غير الأمريكية، ورأت المستخدمين يختارون Fish بنسبة ثلاثة إلى واحد في المقارنات الجانبية.

القطاع
فيديو الذكاء الاصطناعي / أدوات المبدعين
المنطقة
عالمي
حالة الاستخدام
استنساخ الصوت لفيديو الذكاء الاصطناعي
تم النقل من
ElevenLabs
النشر
Cloud API
وقت القراءة
4 دقائق
3:1×

معدل اختيار Fish Audio مقارنة بمزوّدي TTS البديلين في مقارنات المستخدمين الجانبية على HeyGen.

HeyGen

John Wu

مدير هندسة الصوت في HeyGen

"Fish نموذج صوتي رائع لتعظيم تشابه الصوت في الأصوات الفريدة جدا."

الرئيسة التنفيذية في Fish Audio

Rissa Cao

"HeyGen هي المكان الذي تصبح فيه جودة استنساخ الصوت الأهم. منشئو المعرفة لا يحتاجون إلى صوت يبدو مشابها لهم فحسب، بل يحتاجون إلى صوت يبدو مثلهم، بلكنتهم وكل تفاصيلهم. هذا المعيار، الذي تفشل عنده معظم نماذج TTS عندما تغادر الإنجليزية الأمريكية، هو بالضبط ما صممنا S2 Pro لتجاوزه. رؤية مستخدمي HeyGen يختارون Fish بنسبة ثلاثة إلى واحد في اختبارات المقارنة المباشرة هي التحقق الذي بنينا النموذج من أجله."
HeyGen

عن HeyGen — فيديو AI لصنّاع المعرفة.

HeyGen هي منصة فيديو AI رائدة لصنّاع المحتوى المعتمد على المعرفة: المعلّمين، وبناة الدورات، ومسؤولي التواصل التجاري، وصنّاع المحتوى الذين يحولون الخبرة إلى فيديو على نطاق واسع. تتيح المنصة إنتاج فيديو احترافي مولّد بالذكاء الاصطناعي دون معدات استوديو أو موهبة صوتية محترفة أو أسابيع من الإنتاج.

يقع الصوت في مركز كل فيديو تنتجه HeyGen. بالنسبة إلى صانع معرفة يعرف جمهوره صوته مسبقًا، يجب أن يكون صوت AI هو صوته هو: لا راويًا عامًا، ولا تقريبًا قريبًا، بل الصوت الحقيقي باللهجة الحقيقية التي يتعرف عليها الجمهور. هذا هو المستوى الذي يجب أن يحققه استنساخ الصوت لفيديو AI.

مشكلة استنساخ الصوت في ElevenLabs لللكنات الإنجليزية غير الأمريكية.

قبل تقييم Fish Audio، كانت HeyGen تستخدم ElevenLabs كطبقة TTS في مسار توليد فيديو AI. كانت المنصة تعمل وكانت الأصوات مفهومة. لكن مشكلة بنيوية ظلت تظهر في ملاحظات المستخدمين: مشكلات تشابه الصوت، خصوصًا لدى المبدعين ذوي اللكنات الإنجليزية غير الأمريكية.

يتحدث صناع المعرفة باللكنات التي يملكونها. الأستراليون يبدون أستراليين، والهنود يبدون هنودًا. البريطاني، الجنوب أفريقي، السنغافوري، الإيرلندي، الاسكتلندي، الفلبيني، الكاريبي — خريطة لكنات الإنجليزية العالمية ليست حالة هامشية لـ HeyGen، بل هي شكل قاعدة المبدعين الدولية.

محرك TTS الذي ينتج إنجليزية أمريكية قوية لكنه يسطّح كل اللكنات الأخرى إلى شيء أقرب إلى الأمريكية المحايدة يكسر الوعد الأساسي لاستنساخ الصوت في فيديو AI: أن يبدو الفيديو كأنه أنت. كان مستخدمو HeyGen ذوو اللكنات غير الأمريكية يشتكون من الحفاظ على اللكنة؛ ولم تكن الأصوات المستنسخة تحفظ هوية اللكنة التي توقعها المبدعون.

لماذا قيّمت HeyGen سوق TTS بأكمله للحفاظ على اللكنة.

قيّمت HeyGen سوق TTS بأكمله لحل مشكلة اللكنات الإنجليزية غير الأمريكية. لم يكن TTS لهذه اللكنات مقارنة ميزات، بل معيارًا وجوديًا لقاعدة المبدعين الدولية في المنصة.

عبر المزوّدين الذين تم اختبارهم، كان الفارق بين جودة استنساخ الإنجليزية الأمريكية وغير الأمريكية ثابتًا — وثابتًا في الاتجاه الخاطئ. معظم نماذج TTS دُرّبت أولًا على الإنجليزية الأمريكية ثم كُيّفت مع لكنات أخرى. ظهر هذا التكييف في الأصوات المستنسخة على شكل إيقاع مسطّح، وحروف علة محايدة، وفقدان واضح لهوية اللكنة .

لماذا اختارت HeyGen منصة Fish Audio لجودة استنساخ الصوت.

حصلت Fish Audio على اختيار HeyGen وفق معيار أهم من غيره: جودة استنساخ الصوت للأصوات الفريدة، خصوصًا الأصوات ذات اللكنات الإنجليزية غير الأمريكية.يحافظ نموذج Fish S2 Pro على هوية اللكنة في الصوت المصدر بدلًا من تطبيعها نحو خط أساس أمريكي، وهو تحديدًا نمط الفشل الذي ظهر في اختبارات HeyGen لدى مزوّدين آخرين.

بالنسبة إلى HeyGen، هذه ليست تفصيلة تقنية. إنها الفرق بين أن يسمع جمهور صانع المعرفة الشخص الذي يعرفونه أو يسمعوا غريبًا اصطناعيًا. جودة استنساخ الصوت، لا الكمون ولا التكلفة، كانت العامل الحاسم.

كيف تستخدم HeyGen واجهة Fish Audio السحابية لتوليد صوت فيديو AI.

تنشر HeyGen منصة Fish Audio عبر cloud API لتوليد TTS للفيديوهات التي ينتجها عملاؤها على المنصة. يعمل التكامل على نطاق الإنتاج: كل فيديو ينشره صانع معرفة عبر HeyGen باستخدام صوت مدعوم من Fish يمر عبر نموذج Fish S2 Pro.

ما يقوله صناع المعرفة عن جودة الصوت.

الإشارة الأكثر دلالة من المستخدمين ليست المديح، بل الصمت حول ما كان سابقًا أعلى شكوى. ثلاث إشارات من قاعدة مبدعي HeyGen منذ الانتقال:

· معدل اختيار 3:1
في اختبارات الصوت جنبًا إلى جنب على HeyGen، يختار المبدعون Fish لفيديوهاتهم ثلاث مرات أكثر من البدائل.
· عمق عاطفي: توقفت شكاوى اللكنة
توقف المبدعون ذوو اللكنات الإنجليزية غير الأمريكية عن الشكوى من الحفاظ على اللكنة، وهي أعلى تذكرة قبل الانتقال.
· ملاحظات إيجابية حول جودة الصوت
وصلت جودة استنساخ الصوت عبر قاعدة مبدعي HeyGen الدولية إلى ما يعرفه الجمهور بالفعل.

نتائج التكامل.

المنتجات المستخدمة: Fish Audio S2 Pro · Text-to-Speech (cloud API)

معدل اختيار 3:1 لـ Fish Audio مقارنة بمزوّدي TTS بديلين في مقارنات جنبًا إلى جنب على HeyGen.

توقفت شكاوى اللكنات الإنجليزية غير الأمريكية عبر قاعدة مبدعي HeyGen الدولية.

تم تقييم سوق TTS بأكمله قبل اختيار Fish Audio؛ كان الحفاظ على اللكنة العامل الحاسم.

الانتقال من ElevenLabs إلى Fish Audio من أجل جودة استنساخ الصوت.

ما الخطوة التالية لـ HeyGen و Fish Audio.

مع استمرار HeyGen في توسيع قاعدة منشئي المعرفة عالميا، يبقى Fish Audio طبقة جودة الصوت خلف فيديو الذكاء الاصطناعي. تتقدم اللهجات واللغات الجديدة وقدرات استنساخ الصوت الجديدة مع توسع HeyGen دوليا.

Fish Audio

هل تبني منتجات استنساخ صوتي؟

تحدث إلى فريقنا حول تشابه الصوت للأصوات الفريدة، والحفاظ على اللكنات الإنجليزية غير الأمريكية، وتكامل Cloud API على نطاق إنتاجي.