عام واحد.

$52M تمويل تأسيسي.

8M+ مبدع.

اقرأ قصتنا
27 يوليو 2026شركة

5 نماذج، 22 شخصاً، عام واحد

5 نماذج، 22 شخصاً، عام واحد

جمعت Fish Audio تمويلاً أولياً بقيمة 52 مليون دولار. كيف تحول مشروع هواية على بطاقة 4090 واحدة إلى هذا، وماذا نبني تالياً. اقرأ قصتنا.

يمثل اليوم إنجازاً مذهلاً آخر لشركة Fish Audio. نعلن عن تمويل أولي بقيمة 52 مليون دولار في الذكرى السنوية الأولى لتأسيسنا. شكراً لشركتي Coreline Ventures و Capital Today، اللتين قادتا هذه الجولة، بمشاركة من 359 Capital، و Play Time، و HF0، و 645 Ventures، و Parable، و Carya Venture Partners، و Alphalist Partners، والمستثمرين الملائكة الذين وضعوا أموالهم عندما لم يكن هناك الكثير لنتطلع إليه.

تحويل النص إلى كلام كان جيداً بما يكفي لمدة عقد من الزمان تقريباً، طالما أنك تحتاج إلى جملة واحدة فقط. تظهر التصدعات بحلول الجملة العاشرة. تفشل الفئة بأكملها في نفس المكان، ولنفس السبب: نطق الكلمات بشكل صحيح وتقديمها بشكل صحيح هما مشكلتان مختلفتان، وتقريباً الجميع عملوا فقط على المشكلة الأولى.

سنوات من العمل في مجال الذكاء الاصطناعي الصوتي في Amazon Alexa و Meta علمتني أين ينتهي نظام TTS التقليدي: الصوت المبني للقراءة لا يتعلم الأداء أبداً. لذا بدأنا من الطرف الآخر. Fish Audio ليس مجرد مساعد صوتي أفضل، بل هو الطبقة الصوتية لكل ما يأتي بعده.

صورة لمؤسسي الشركة يجلسان جنباً إلى جنب على كراسي خشبية، في مواجهة الكاميرا، مع نافذة ممتدة من الأرض حتى السقف وأشجار خارجية في الخلفية.

بطاقة 4090

وصل Shijia Liao، كبير علمائنا، إلى نفس الاستنتاج من اتجاه مختلف. كمهندس أبحاث في NVIDIA يعمل على الفيديو، قضى وقت فراغه في مشاهدة بث VTuber ولم يستطع تجاوز مدى خلو الأصوات من الحياة. بدأ في تدريب النماذج على بطاقة 4090 واحدة في غرفته، مراهناً في وقت مبكر على بنية ذاتية الانحدار مزدوجة لم يلحق بها بقية الصناعة إلا بعد عامين. أصبح ذلك العمل هو الأساس لـ S2.

ما أنجزناه في عام واحد

  • إطلاق خمسة نماذج صوتية متطورة. أربعة لتحويل النص إلى كلام، وواحد لتحويل الكلام إلى نص.
  • توسيع الفريق من 3 إلى 22 شخصاً، وما زلنا نوظف.
  • من الصفر إلى 21 مليون دولار من الإيرادات السنوية المتكررة.
  • أكثر من 8 ملايين منشئ محتوى ومطور ومؤسسة على المنصة.
  • أكثر من 2 مليون نموذج صوتي في مكتبة المجتمع.
  • S2.1 Pro، المفضل لدى 66% من المستمعين على المنافسين الرائدين في اختبارات الاستماع العمياء.
  • أكثر من 83 لغة مع إيقاع لغوي طبيعي وتحكم في المشاعر على مستوى الكلمات عبر أكثر من 15,000 وحدة تحكم باللغة الطبيعية.

المجتمع هو من بنى النموذج

نقوم بإجراء تدريب لاحق بناءً على تفضيلات المستخدمين الحقيقية، مما يعني أن النموذج يتحسن كلما استخدمه الناس أكثر. لهذا السبب نتفوق في الإنجليزية بلكناتها المختلفة، والماندرين، واليابانية، والكورية، والإسبانية، حيث تنهار النماذج المدربة غالباً على الإنجليزية الأمريكية القياسية. جاءت هذه القدرة من أشخاص استخدموا الأداة بلغات ولكنات وحالات استخدام استثنائية لم نكن لنفكر في اختبارها أبداً.

تحولت Fish Speech من مجرد مستودع برمجيات إلى شركة بفضل مطوري الألعاب، وعشاق الأنمي، والأشخاص الذين يدبلجون الشخصيات من أجل المتعة. منذ البداية، آمنا بالشفافية والانفتاح، وجعل الذكاء الاصطناعي الصوتي التعبيري عالي الجودة متاحاً للجميع.

وثمانية ملايين منكم وثقوا بنا للقيام بذلك.

النموذج الذي تثق به المؤسسات الآن

هذه الثقة هي السبب في توجه المؤسسات الكبرى إلى Fish Audio أيضاً. جنباً إلى جنب مع المطورين، تمثل المؤسسات الآن ثلثي إيراداتنا.

نحن نوفر لهم استمرارية الخدمة، وزمن وصول منخفض، ووضعية أمنية تجتاز عمليات الشراء المعقدة: نشر في الموقع (on-premises)، وسياسات عدم الاحتفاظ بالبيانات، وتكوينات متوافقة مع HIPAA، مدمجة منذ البداية. يتفوق S2.1 Pro بالفعل في اختبارات الاستماع العمياء على النماذج الرائدة، ويعمل بسرعة تزيد عن 8,000 رمز في الثانية على بطاقة H200 واحدة، ويصمد في اللغات التي تتعثر فيها النماذج المضبوطة لجهة واحدة.

تأتي المؤسسات إلينا لأن تقديم الأداء بشكل صحيح، وليس الكلمات فقط، هو بالضبط المشكلة التي شرعنا في حلها. إنها نفس المهمة التي أصبحنا الآن قادرين على المضي فيها قدماً.

ماذا بعد؟

لم يكن تحويل النص إلى كلام هو الهدف النهائي أبداً. كان الجزء الذي يمكننا بناؤه أولاً باستخدام وحدة معالجة رسومات (GPU) واحدة لإثبات النظرية: الأداء يهم بقدر الكلمات، ولم يكن أحد يحل هذه المشكلة.

الآن ننتقل إلى بقية الأجزاء. نموذج لغة فهم الصوت (Audio LM) وتحويل الكلام إلى كلام. كما نضاعف جهودنا في أدوات المطورين وواجهة برمجة التطبيقات (API)، ونوسع فريق المؤسسات لدينا، ونعمق شراكاتنا مع LiveKit و Retell لجلب الصوت التعبيري إلى أماكن أكثر وبسرعة أكبر.

مجاني طوال شهر أغسطس

للاحتفال بهذا الإنجاز الكبير، يتوفر S2.1 Pro مجاناً لكل مطور عبر واجهة برمجة التطبيقات (API) حتى نهاية أغسطس. هذا هو نفس النموذج الذي تدفع مقابله المؤسسات. كما نقدم خصماً بنسبة 50% على خطط منشئي المحتوى و3 أشهر مجانية إذا كنت تنتقل من مزود آخر.

السبب في قدرتنا على القيام بذلك هو تقني، ويعود الفضل لفريق الأبحاث لدينا. لقد أعادوا بناء بنية الاستدلال بالكامل هذا العام: نوى FP8 مخصصة، وأكثر من 8,000 رمز في الثانية على بطاقة H200 واحدة. أدى ذلك إلى خفض تكلفة الطلب الواحد بدرجة كافية جعلت منح النموذج مجاناً استراتيجية ناجحة.

شكراً لكم

قبل عام واحد، كانت Fish Audio مشروع هواية بدأ من غرفة المعيشة لدينا. كل من درب صوتاً، أو دبلج شخصية، أو بنى على واجهة برمجة التطبيقات، أو راهن علينا قبل أن يكون هناك الكثير للمراهنة عليه - هذا النجاح ملككم بقدر ما هو ملكنا.

لقد ارتكبنا الكثير من الأخطاء على طول الطريق. نحن على وشك الحصول على الموارد للقيام بالكثير من الأشياء بشكل صحيح.

نخب العام الثاني.

Rissa Cao

Rissa CaoX

Rissa is the CEO and co-founder of Fish Audio, pushing breakthroughs in AI voice technology. Find her latest work at @rissa_cao.

اقرأ المزيد من Rissa Cao

أنشئ أصواتًا تبدو حقيقية

ابدأ في إنشاء أعلى جودة صوت اليوم

هل لديك حساب بالفعل؟ تسجيل الدخول