استنساخ الصوت لفيديو الذكاء الاصطناعي، 3 إلى 1 مقابل البدائل.
كيف انتقلت HeyGen من ElevenLabs إلى Fish Audio لحل مشاكل تشابه الصوت مع لهجات الإنجليزية غير الأمريكية، ورأت المستخدمين يختارون Fish بنسبة ثلاثة إلى واحد في المقارنات الجانبية.
كيف انتقلت HeyGen من ElevenLabs إلى Fish Audio لحل مشاكل تشابه الصوت مع لهجات الإنجليزية غير الأمريكية، ورأت المستخدمين يختارون Fish بنسبة ثلاثة إلى واحد في المقارنات الجانبية.
معدل اختيار Fish Audio مقارنة بمزوّدي TTS البديلين في مقارنات المستخدمين الجانبية على HeyGen.
John Wu
مدير هندسة الصوت في HeyGen
"Fish نموذج صوتي رائع لتعظيم تشابه الصوت في الأصوات الفريدة جدا."
الرئيسة التنفيذية في Fish Audio
Rissa Cao

"HeyGen هي المكان الذي تصبح فيه جودة استنساخ الصوت الأهم. منشئو المعرفة لا يحتاجون إلى صوت يبدو مشابها لهم فحسب، بل يحتاجون إلى صوت يبدو مثلهم، بلكنتهم وكل تفاصيلهم. هذا المعيار، الذي تفشل عنده معظم نماذج TTS عندما تغادر الإنجليزية الأمريكية، هو بالضبط ما صممنا S2 Pro لتجاوزه. رؤية مستخدمي HeyGen يختارون Fish بنسبة ثلاثة إلى واحد في اختبارات المقارنة المباشرة هي التحقق الذي بنينا النموذج من أجله."

HeyGen هي منصة فيديو AI رائدة لصنّاع المحتوى المعتمد على المعرفة: المعلّمين، وبناة الدورات، ومسؤولي التواصل التجاري، وصنّاع المحتوى الذين يحولون الخبرة إلى فيديو على نطاق واسع. تتيح المنصة إنتاج فيديو احترافي مولّد بالذكاء الاصطناعي دون معدات استوديو أو موهبة صوتية محترفة أو أسابيع من الإنتاج.
يقع الصوت في مركز كل فيديو تنتجه HeyGen. بالنسبة إلى صانع معرفة يعرف جمهوره صوته مسبقًا، يجب أن يكون صوت AI هو صوته هو: لا راويًا عامًا، ولا تقريبًا قريبًا، بل الصوت الحقيقي باللهجة الحقيقية التي يتعرف عليها الجمهور. هذا هو المستوى الذي يجب أن يحققه استنساخ الصوت لفيديو AI.
قبل تقييم Fish Audio، كانت HeyGen تستخدم ElevenLabs كطبقة TTS في مسار توليد فيديو AI. كانت المنصة تعمل وكانت الأصوات مفهومة. لكن مشكلة بنيوية ظلت تظهر في ملاحظات المستخدمين: مشكلات تشابه الصوت، خصوصًا لدى المبدعين ذوي اللكنات الإنجليزية غير الأمريكية.
يتحدث صناع المعرفة باللكنات التي يملكونها. الأستراليون يبدون أستراليين، والهنود يبدون هنودًا. البريطاني، الجنوب أفريقي، السنغافوري، الإيرلندي، الاسكتلندي، الفلبيني، الكاريبي — خريطة لكنات الإنجليزية العالمية ليست حالة هامشية لـ HeyGen، بل هي شكل قاعدة المبدعين الدولية.
محرك TTS الذي ينتج إنجليزية أمريكية قوية لكنه يسطّح كل اللكنات الأخرى إلى شيء أقرب إلى الأمريكية المحايدة يكسر الوعد الأساسي لاستنساخ الصوت في فيديو AI: أن يبدو الفيديو كأنه أنت. كان مستخدمو HeyGen ذوو اللكنات غير الأمريكية يشتكون من الحفاظ على اللكنة؛ ولم تكن الأصوات المستنسخة تحفظ هوية اللكنة التي توقعها المبدعون.


قيّمت HeyGen سوق TTS بأكمله لحل مشكلة اللكنات الإنجليزية غير الأمريكية. لم يكن TTS لهذه اللكنات مقارنة ميزات، بل معيارًا وجوديًا لقاعدة المبدعين الدولية في المنصة.
عبر المزوّدين الذين تم اختبارهم، كان الفارق بين جودة استنساخ الإنجليزية الأمريكية وغير الأمريكية ثابتًا — وثابتًا في الاتجاه الخاطئ. معظم نماذج TTS دُرّبت أولًا على الإنجليزية الأمريكية ثم كُيّفت مع لكنات أخرى. ظهر هذا التكييف في الأصوات المستنسخة على شكل إيقاع مسطّح، وحروف علة محايدة، وفقدان واضح لهوية اللكنة .
حصلت Fish Audio على اختيار HeyGen وفق معيار أهم من غيره: جودة استنساخ الصوت للأصوات الفريدة، خصوصًا الأصوات ذات اللكنات الإنجليزية غير الأمريكية.يحافظ نموذج Fish S2 Pro على هوية اللكنة في الصوت المصدر بدلًا من تطبيعها نحو خط أساس أمريكي، وهو تحديدًا نمط الفشل الذي ظهر في اختبارات HeyGen لدى مزوّدين آخرين.
بالنسبة إلى HeyGen، هذه ليست تفصيلة تقنية. إنها الفرق بين أن يسمع جمهور صانع المعرفة الشخص الذي يعرفونه أو يسمعوا غريبًا اصطناعيًا. جودة استنساخ الصوت، لا الكمون ولا التكلفة، كانت العامل الحاسم.

تنشر HeyGen منصة Fish Audio عبر cloud API لتوليد TTS للفيديوهات التي ينتجها عملاؤها على المنصة. يعمل التكامل على نطاق الإنتاج: كل فيديو ينشره صانع معرفة عبر HeyGen باستخدام صوت مدعوم من Fish يمر عبر نموذج Fish S2 Pro.
الإشارة الأكثر دلالة من المستخدمين ليست المديح، بل الصمت حول ما كان سابقًا أعلى شكوى. ثلاث إشارات من قاعدة مبدعي HeyGen منذ الانتقال:
المنتجات المستخدمة: Fish Audio S2 Pro · Text-to-Speech (cloud API)
معدل اختيار 3:1 لـ Fish Audio مقارنة بمزوّدي TTS بديلين في مقارنات جنبًا إلى جنب على HeyGen.
توقفت شكاوى اللكنات الإنجليزية غير الأمريكية عبر قاعدة مبدعي HeyGen الدولية.
تم تقييم سوق TTS بأكمله قبل اختيار Fish Audio؛ كان الحفاظ على اللكنة العامل الحاسم.
الانتقال من ElevenLabs إلى Fish Audio من أجل جودة استنساخ الصوت.
تحدث إلى فريقنا حول تشابه الصوت للأصوات الفريدة، والحفاظ على اللكنات الإنجليزية غير الأمريكية، وتكامل Cloud API على نطاق إنتاجي.