عام واحد.

$52M تمويل تأسيسي.

8M+ مبدع.

اقرأ قصتنا
23 يونيو 2026أبحاث

Fish Audio S2.1 Pro: واجهة برمجة تطبيقات مجانية لتحويل النص إلى كلام للمطورين

Fish Audio S2.1 Pro: واجهة برمجة تطبيقات مجانية لتحويل النص إلى كلام للمطورين

ملخص سريع:

  • S2.1 Pro، أحدث نموذج صوتي من Fish Audio، متاح الآن كواجهة برمجة تطبيقات (API) مجانية لتحويل النص إلى كلام

  • 83 لغة، استخدام غير محدود بموجب سياسة الاستخدام العادل

  • اسم النموذج: s2.1-pro-free — أضفه ببساطة إلى طلبات Fish API الحالية

جرب S2.1 Pro مجانًا — أول صوت خلال 5 دقائق ←

يونيو 2026 | أصبح نموذج S2.1 Pro من Fish Audio متاحاً الآن كواجهة برمجة تطبيقات مجانية لتحويل النص إلى كلام مع وصول غير محدود بموجب سياسة الاستخدام العادل.


لماذا كان الذكاء الاصطناعي الصوتي عالي الجودة مكلفاً دائماً

إذا كنت قد قضيت أي وقت في تقييم واجهات برمجة تطبيقات تحويل النص إلى كلام، فأنت تعرف النمط بالفعل: النماذج التي تبدو جيدة حقاً تكلف مالاً.

تمنحك الخطة المجانية من ElevenLabs حوالي 10,000 رصيد شهرياً (حوالي 6 - 10 دقائق) قبل أن تظهر لك مطالبة الدفع. أما OpenAI TTS فهو بنظام الدفع حسب الاستخدام ولا توجد خطة مجانية على الإطلاق. وأحدث نماذج Gemini TTS من Google — وهي الأكثر تقدماً لديهم — ليس لها استخدام مجاني: تدفع منذ أول رمز (token). هذا النمط متسق في جميع أنحاء الصناعة: لطالما كانت جودة الصوت المتطورة ميزة مدفوعة.

يخلق هذا مشكلة حقيقية للمطورين. ينمو سوق مولدات الصوت بالذكاء الاصطناعي بنسبة تقارب 20% سنوياً — لكن الأدوات المتاحة لبناء منتجات تدعم الصوت ظلت خلف جدران الدفع. لا يمكنك تقييم نموذج بشكل صحيح بـ 10,000 رصيد فقط. لا يمكنك بناء نموذج أولي لوكيل صوتي، أو اختبار نظام إنتاج الكتب الصوتية، أو التجربة في استنساخ الصوت دون الالتزام بميزانية مسبقة أو قضاء أسابيع في صراع مع البدائل مفتوحة المصدر التي تتطلب بنية تحتية خاصة بك لوحدات معالجة الرسومات (GPU).

تغير Fish Audio هذا الواقع اليوم.


ما هو S2.1 Pro؟

S2.1-Pro benchmark: throughput (tok/s) and TTFB p50 (ms) across concurrency levels from 1 to 512, showing 8,006 tok/s at c=64 and 73.2ms TTFB at c=1

S2.1 Pro هو أحدث نموذج صوتي متطور من Fish Audio حالياً — وهو أفضل نموذج لدينا، ومتاح الآن لكل مطور مجاناً عبر واجهة برمجة التطبيقات. إنه نموذج تأليف كلام عصبي مصمم لتوليد صوت بالذكاء الاصطناعي بجودة إنتاجية، مع نقاط قوة خاصة في البث منخفض زمن الاستجابة، والتحويل متعدد اللغات، واستنساخ الصوت. يعتمد النموذج على أساس S2، الذي أصدرناه بأوزان مفتوحة في وقت سابق من هذا العام.

الأداء

  • معدل فوز 61% مقارنة بالجيل السابق S2 Pro في تقييمات الاستماع المباشرة — راجع مقارنة مزودي TTS العمياء لمزيد من السياق
  • ~70ms زمن الوصول لأول صوت (TTFA) في الطلب الواحد — انخفاضاً من ~100ms في الجيل السابق
  • تحسن بنسبة 2x+ في الإنتاجية تحت أحمال الاستخدام المتزامن العالية

للاطلاع على الخلفية التقنية الكاملة، راجع ورقتنا البحثية: هنا

تغطية اللغات

يدعم S2.1 Pro 83 لغة، بما في ذلك الإنجليزية، واليابانية، والصينية، والكورية، والإسبانية، والعربية، والفرنسية، والألمانية، والبرتغالية، والروسية، وعشرات اللغات الأخرى. نفس النموذج يتعامل مع جميع اللغات — لا توجد نقاط نهاية منفصلة، ولا تسعير خاص بكل لغة.

زمن الاستجابة (Latency)

يوفر S2.1-Pro حوالي 90ms كزمن وصول لأول صوت (TTFA) على الواجهة القياسية، مما يجعله قابلاً للاستخدام في الوكلاء الصوتيين المباشرين وأنظمة الحوار التفاعلية. إذا كنت بحاجة إلى تحكم دقيق في نبرة الكلام وأسلوب الإلقاء، فراجع أيضاً قدرات التحكم الصوتي على مستوى الكلمة في S2.


لماذا يمكن لـ Fish Audio تقديم هذا مجاناً الآن

Fish Audio S2.1-Pro inference infrastructure: NVIDIA H200 with FP8 GEMM and custom scheduler delivering 125 audio tok/s per request (RTF 0.17) and ~70ms TTFA

باختصار: قمنا بإعادة بناء بنية الاستدلال (inference stack) من الصفر، وانخفضت التكلفة لكل طلب بشكل كبير بما يكفي لنتمكن من تحملها.

نوى GPU مخصصة (Custom GPU Kernels)

قمنا بتطوير fish-scales-ops، وهي مكتبة FP8 GEMM و FlashAttention بجودة إنتاجية تستهدف معمارية NVIDIA Hopper (H100/H200) و Blackwell (RTX 6000 PRO). في أشكال فك التشفير التي تهم تشغيل الذكاء الاصطناعي الصوتي، يتفوق مسار MXFP8 الخاص بنا على مرجع torch.compile-fused cuBLAS بنسبة 2.1–4.3 ضعفاً. لا تحتاج إلى فهم أي من هذا لاستخدام واجهة برمجة التطبيقات — ولكن هذا هو السبب في أن الخطة المجانية مستدامة.

إنتاجية أعلى

على معالج H200 واحد مع تكميم FP8، يحافظ النظام على إنتاجية مخرجات تزيد عن 8,000 رمز/ثانية عند 64 طلباً متزامناً. المزيد من الإنتاجية لكل وحدة معالجة رسومات يعني خدمة المزيد من الطلبات مقابل كل دولار، وهذا ما يجعل الوصول المجاني غير المحدود ممكناً اقتصادياً.


ماذا يعني "مجاني" بالفعل

نحن نفضل أن نكون صريحين بشأن القيود بدلاً من إخفائها.

ما ستحصل عليه:

  • اسم النموذج: s2.1-pro-free
  • وصول بحجم كبير بدون سقف محدد لعدد الحروف (يخضع لسياسة الاستخدام العادل)
  • نفس نقطة نهاية API الخاصة بالخطط المدفوعة — لا يوجد تكامل منفصل

القيود الحالية:

  • المدة: الوصول المجاني متاح حتى 24 يوليو 2026 الوصول المجاني متاح حتى نهاية يوليو 2026 الوصول المجاني متاح حتى 31 أغسطس 2026 — سنقوم بالإبلاغ عن أي تغييرات بإشعار مسبق.
    • تحديث (يونيو 2026): نقوم بتمديد الفترة المجانية لتشمل شهر يوليو بالكامل. نريد للمطورين أن يحصلوا على شهر كامل من البناء والتقييم والإطلاق دون انقطاع — وليس مجرد عد تنازلي لموعد نهائي.
    • تحديث (يوليو 2026): نقوم بتمديد الوصول المجاني مرة أخرى حتى 31 أغسطس 2026. لقد كان من الملهم حقاً رؤية ما بناه مطورو Fish Audio باستخدام S2.1 Pro، ونريد منح هذا الزخم مساحة أكبر للنمو.
  • لا يوجد اتفاق مستوى خدمة (SLA): لا توجد ضمانات لوقت التشغيل أو زمن الوصول؛ النموذج مصمم للتجربة وبناء النماذج الأولية.
  • لا يوجد ضمان لزمن الاستجابة: يعتمد على أفضل الجهود، وليس تعاقدياً.
  • الاحتفاظ بالبيانات: قد تُستخدم الطلبات لتحسين جودة النموذج — راجع سياسة الخصوصية الخاصة بنا.
  • الاستخدام التجاري: قد تكون هناك قيود على بعض السيناريوهات التجارية. يجب على المنتجات التي تحقق عوائد سنوية متكررة (ARR) تزيد عن مليون دولار التواصل معنا قبل استخدام S2.1 Pro Free. راجع الأسعار وحدود المعدل لمزيد من التفاصيل.

إذا كنت بحاجة إلى ضمانات إنتاجية لاتفاق مستوى الخدمة وزمن الاستجابة، فالخطط المدفوعة متاحة. هذه الخطة هي المكان المناسب للبناء والتقييم واتخاذ القرار.


كيفية استخدام API المجاني لتحويل النص إلى كلام: دليل سريع لـ S2.1 Pro

احصل على مفتاح API الخاص بك من fish.audio/app/api-keys، ثم قم بإجراء طلبك الأول. تقبل Fish API الطلبات المشفرة بصيغة msgpack وتعيد الصوت بالتنسيق الذي تختاره. المرجع الكامل في توثيق API.

JavaScript

import { writeFile } from "fs/promises";

const body = {
  text: "مرحباً بالعالم!",
  reference_id: "your_model_id",
  format: "mp3",
};

const res = await fetch("https://api.fish.audio/v1/tts", {
  method: "POST",
  headers: {
    Authorization: "Bearer <YOUR_API_KEY>",
    "Content-Type": "application/json",
    model: "s2.1-pro-free",
  },
  body: JSON.stringify(body),
});

if (!res.ok) {
  throw new Error(`TTS request failed: ${res.status} ${await res.text()}`);
}

const buffer = Buffer.from(await res.arrayBuffer());
await writeFile("output.mp3", buffer);

Python

import httpx

body = {
    "text": "مرحباً بالعالم!",
    "reference_id": "your_model_id",
    "format": "mp3",
}

with httpx.Client() as client:
    res = client.post(
        "https://api.fish.audio/v1/tts",
        headers={
            "Authorization": "Bearer <YOUR_API_KEY>",
            "Content-Type": "application/json",
            "model": "s2.1-pro-free",
        },
        json=body,
    )

res.raise_for_status()

with open("output.mp3", "wb") as f:
    f.write(res.content)

التغيير الوحيد عن أي طلب Fish Audio API آخر: قم بتعيين model: "s2.1-pro-free" في الترويسات (headers). هذا كل شيء.

احصل على مفتاح API المجاني الخاص بك ←


S2.1 Pro مقابل ElevenLabs وأفضل واجهات برمجة تطبيقات TTS في عام 2026

معلومات المنافسين أدناه مستندة إلى التوثيق المتاح علناً وصفحات التسعير اعتباراً من يونيو 2026. قد تتغير الأسعار والميزات — يرجى التحقق مباشرة من كل مزود قبل اتخاذ قرار الإنتاج.

Comparison of free TTS APIs in 2026: Fish Audio S2.1-Pro vs ElevenLabs vs OpenAI TTS vs Google Cloud TTS

للحصول على تحليل مستقل أعمق، راجع مقارنة مزودي TTS العمياء.

الخلاصة: من بين مزودي واجهات برمجة تطبيقات TTS الرئيسيين الذين قمنا بتقييمهم، تقدم Fish Audio حالياً أحد أكثر نماذج الوصول المجاني سخاءً — والوحيد الذي تشغل فيه الخطة المجانية نفس النموذج المتطور الذي تشغله الخطة المدفوعة، وبدون سقف استخدام صارم. الخطة المجانية لـ ElevenLabs هي فعلياً تجريبية بـ 10,000 رصيد. أما أحدث TTS من Google (Gemini TTS) فلا توجد له خطة مجانية على الإطلاق.

هل تبحث عن بديل مجاني لـ ElevenLabs لا يساوم على جودة النموذج؟ S2.1 Pro متاح الآن بدون سقف استخدام.

هل تبحث عن بديل مجاني لـ OpenAI TTS؟ عرض TTS من OpenAI لا يحتوي على خطة مجانية — S2.1 Pro هو خيار مقنع للتقييم أولاً.

راجع وثائق API الكاملة وابدأ البناء ←


ماذا يمكنك أن تبني باستخدامه

الخطة المجانية غير مقيدة عمداً في حالات الاستخدام. إليك السيناريوهات التي تميل فيها تركيبة S2.1 Pro من توليد الصوت بالذكاء الاصطناعي منخفض زمن الاستجابة، والدعم متعدد اللغات، واستنساخ الصوت، إلى إحداث الفرق الأكبر.

الوكلاء الصوتيون

يعتمد نجاح الذكاء الاصطناعي الحواري في الوقت الفعلي على زمن الاستجابة. عند حوالي 90ms TTFA للمكالمات القياسية، فإن S2.1 Pro سريع بما يكفي لحوار طبيعي متبادل الأدوار. ادمجه مع طبقة تحويل الكلام إلى نص ونموذج لغة كبير (LLM) للحصول على خط إنتاج صوتي كامل بدون فاتورة لكل حرف. يمكنك أيضاً دمج S2.1 Pro في سير عمل الوكلاء عبر دعمنا لـ MCP ومهارات الوكلاء.

الكتب الصوتية والسرد الطويل

دعم 83 لغة ونبرة الكلام الطبيعية تجعل S2.1 Pro مناسباً جداً لإنتاج الكتب الصوتية وتأليف الكلام طويل المدى. الاستخدام غير المحدود يعني أنه يمكنك معالجة مخطوطات كاملة دون مراقبة عداد الحروف أو الشراء المسبق للأرصدة.

استنساخ الصوت

يدعم S2.1 Pro استنساخ الصوت من عينة صوتية مرجعية عبر واجهة برمجة التطبيقات — مرر عينة صوتية مرجعية وسيقوم النموذج بتأليف الكلام بذلك الصوت. قم ببناء تطبيقات صوتية مخصصة، أو توطين المحتوى مع الحفاظ على هوية المتحدث، أو توليد أصوات شخصيات للألعاب والرسوم المتحركة. استنساخ الصوت متاح في الخطة المجانية، ويخضع لنفس سياسة الاستخدام العادل.

التطبيقات متعددة اللغات

إذا كان تطبيقك يخدم مستخدمين بلغات متعددة، فإن تغطية 83 لغة عبر واجهة برمجة تطبيقات واحدة متسقة للذكاء الاصطناعي الصوتي هي تبسيط كبير مقارنة بالبدائل التي تتطلب نقاط نهاية منفصلة لكل لغة أو تفرض أسعاراً مرتفعة لتأليف الكلام بغير الإنجليزية.

حوارات الشخصيات (NPC) في الألعاب

تستفيد خطوط إنتاج أصوات الألعاب من الإنتاجية العالية والتكلفة المتوقعة لكل طلب. الاستخدام المجاني غير المحدود يجعل من العملي توليد مكتبات حوارات كبيرة والتجربة بحرية أثناء التطوير قبل الالتزام بميزانية إنتاجية.


متاح عبر شبكة شركائنا

يتوفر S2.1 Pro أيضاً عبر عدد متزايد من منصات الشركاء، بما في ذلك Runware، و Retell، و Sierra، وغيرها.

إذا كنت تبني بالفعل على إحدى هذه المنصات، فيمكنك الوصول إلى S2.1 Pro دون أي تكامل أو إعداد إضافي — فقط استخدم ما لديك بالفعل.

نحن نعمل بنشاط على توسيع شبكة الشركاء. إذا كنت مزود منصة أو بنية تحتية وتهتم بدمج S2.1 Pro، تواصل مع فريقنا لاستكشاف الإمكانيات.


الاستخدام العادل وما القادم

تعمل الخطة المجانية بموجب سياسة الاستخدام العادل. نحن نحتفظ بالحق في تقييد الوصول للأنماط التي تبدو وكأنها إساءة استخدام بدلاً من التطوير — الهدف هو حماية الوصول لجميع مجتمع المطورين، وليس إنشاء حدود تعسفية لحالات الاستخدام المشروعة. راجع الأسعار وحدود المعدل لمزيد من التفاصيل.

إليك بعض الأشياء التي يمكنك توقعها:

  • الوصول المجاني متاح الآن لفترة أولية. سنقدم إشعاراً مسبقاً قبل حدوث أي تغيير.
  • الخطط المدفوعة مع ضمانات اتفاق مستوى الخدمة، وزمن الاستجابة، والتراخيص التجارية متاحة لأحمال العمل الإنتاجية.
  • الاستثمار في البنية التحتية مستمر — العمل الهندسي الذي جعل هذه الخطة المجانية ممكنة ليس حدثاً لمرة واحدة.
  • بنية تحتية مفتوحة المصدر: نخطط لفتح مصدر مكونات البنية التحتية خلف S2.1 Pro — نفس التكنولوجيا التي تجعل الخطة المجانية مستدامة.

إذا كنت تقيم Fish Audio للنشر الإنتاجي، فإن الخطة المجانية هي المكان المناسب للبدء. ابنِ شيئاً حقيقياً، وقس ما يهم لتطبيقك، وتواصل معنا عندما تكون مستعداً لمناقشة متطلبات الإنتاج.

لا حاجة لبطاقة ائتمان. لا توجد قائمة انتظار. لا حدود لما يمكنك تجربته.

احصل على مفتاح API المجاني الخاص بك ←

الأسئلة المتكررة

ما هي واجهة برمجة تطبيقات تحويل النص إلى كلام (TTS API)؟
واجهة برمجة تطبيقات تحويل النص إلى كلام (TTS API) هي خدمة ويب تحول النص المكتوب إلى صوت منطوق. يرسل المطورون سلسلة نصية إلى نقطة نهاية API ويتلقون ملفاً صوتياً — عادةً بصيغة MP3 أو WAV أو Opus — يمكن تشغيله في التطبيقات أو تخزينه أو بثه في الوقت الفعلي. تستخدم واجهات برمجة تطبيقات الصوت بالذكاء الاصطناعي الحديثة مثل S2.1 Pro نماذج تأليف كلام عصبي لإنتاج صوت يبدو طبيعياً ويصعب تمييزه عن الكلام البشري.
هل Fish Audio S2.1 Pro مجاني حقاً؟
نعم. يتوفر S2.1 Pro مجاناً عبر Fish API باستخدام اسم النموذج `s2.1-pro-free`. لا يوجد حد صارم لعدد الحروف — يخضع الاستخدام لسياسة الاستخدام العادل لمنع إساءة الاستخدام. لا تحتوي الخطة المجانية على اتفاق مستوى خدمة (SLA) ولا ضمان لزمن الاستجابة، وقد يتم الاحتفاظ بالطلبات لتحسين النموذج. وهي مصممة للتطوير وبناء النماذج الأولية والتقييم. راجع الأسعار وحدود المعدل للحصول على التفاصيل الكاملة.
ما هي أفضل واجهة برمجة تطبيقات TTS مجانية في عام 2026؟
تعتمد أفضل واجهة برمجة تطبيقات TTS مجانية على حالة الاستخدام الخاصة بك. من بين المزودين الرئيسيين: تقدم Fish Audio S2.1 Pro وصولاً مجانياً سخياً لنموذج من الجيل الحالي، بدون سقف استخدام صارم ومع دعم لـ 83 لغة. تقدم ElevenLabs 10,000 رصيد مجاني شهرياً مع إمكانية الوصول إلى مكتبة الأصوات الخاصة بها. أصوات WaveNet القديمة من Google مجانية حتى 4 ملايين حرف شهرياً. أما OpenAI TTS و Gemini TTS من Google فلا توجد لهما خطة مجانية. للمطورين الذين يرغبون في تقييم واجهة برمجة تطبيقات صوتية متطورة دون قيود الميزانية، يعد S2.1 Pro نقطة انطلاق قوية.
كيف تقارن Fish Audio مع ElevenLabs؟
يقدم كل من Fish Audio و ElevenLabs توليد صوت عصبي واستنساخ صوت بجودة عالية. الاختلافات العملية الرئيسية في الخطة المجانية هي: تشغل الخطة المجانية من Fish Audio نفس نموذج S2.1 Pro الموجود في الخطة المدفوعة بدون سقف استخدام صارم، بينما الخطة المجانية لـ ElevenLabs محدودة بـ 10,000 رصيد شهرياً. من حيث تغطية اللغات، تدعم Fish Audio 83 لغة مقابل 70+ لغة في ElevenLabs. تمتلك ElevenLabs مكتبة أكبر من الأصوات الجاهزة ونظاماً بيئياً أكثر رسوخاً للمحتوى الإبداعي. تميل Fish Audio إلى أن تكون أقوى في حالات الاستخدام الموجهة للمطورين والتي تتطلب زمن استجابة منخفضاً، أو استخداماً متزامناً عالياً، أو دعماً متعدد اللغات.
هل تدعم Fish Audio استنساخ الصوت؟
نعم. يدعم S2.1 Pro استنساخ الصوت من عينة صوتية مرجعية. يمكنك تمرير عينة صوتية وسيقوم النموذج بتأليف الكلام بذلك الصوت. يعمل هذا عبر جميع اللغات الـ 83 المدعومة، مما يجعله مفيداً بشكل خاص لتوطين المحتوى حيث يكون الحفاظ على هوية المتحدث أمراً بالغ الأهمية. يعد نظام استنساخ الصوت لدينا من الأقوى في فئته، حيث يوفر اتساقاً عالياً في هوية المتحدث، ونبرة كلام طبيعية، وأداءً مستقراً عبر اللغات واللكنات. استنساخ الصوت متاح في الخطة المجانية، ويخضع لنفس سياسة الاستخدام العادل.
هل يمكنني استخدام Fish Audio تجارياً؟
قد تخضع الخطة المجانية (`s2.1-pro-free`) لقيود في بعض السيناريوهات التجارية. للاستخدام التجاري الإنتاجي مع ترخيص كامل واتفاق مستوى خدمة وعدم الاحتفاظ بالبيانات، يرجى الرجوع إلى خطط Fish Audio المدفوعة. راجع الأسعار وحدود المعدل وشروط الخدمة للاطلاع على السياسة الحالية.
ما هي اللغات التي تدعمها Fish Audio؟
يدعم S2.1 Pro 83 لغة، بما في ذلك الإنجليزية، واليابانية، والكورية، والصينية، والإسبانية، والبرتغالية، والعربية، والفرنسية، والألمانية، والروسية، والإيطالية، والتركية، والهولندية، والبولندية، والفيتنامية، والتايلاندية، والإندونيسية، وغيرها الكثير. يتم خدمة جميع اللغات بواسطة نفس النموذج — لا توجد نقاط نهاية منفصلة أو فئات تسعير خاصة بكل لغة.
Shijia Liao

Shijia LiaoX

Founder & Chief-Scientist of Fish Audio.

اقرأ المزيد من Shijia Liao

أنشئ أصواتًا تبدو حقيقية

ابدأ في إنشاء أعلى جودة صوت اليوم

هل لديك حساب بالفعل؟ تسجيل الدخول