23 يونيو 2026أبحاث

Fish Audio S2.1 Pro: واجهة برمجة تطبيقات (API) مجانية لتحويل النص إلى كلام للمطورين

Fish Audio S2.1 Pro: واجهة برمجة تطبيقات (API) مجانية لتحويل النص إلى كلام للمطورين

ملخص سريع:

  • S2.1 Pro، نموذج الصوت الأكثر تقدماً من Fish Audio، متاح الآن كواجهة برمجة تطبيقات (API) مجانية لتحويل النص إلى كلام.

  • 83 لغة، استخدام غير محدود بموجب سياسة الاستخدام العادل.

  • سلسلة النموذج (Model string): s2.1-pro-free — أضفها ببساطة إلى استدعاءات Fish API الحالية الخاصة بك.

جرب S2.1 Pro مجاناً — أول مقطع صوتي خلال 5 دقائق ←

يونيو 2026 | نموذج S2.1 Pro من Fish Audio متاح الآن كواجهة برمجة تطبيقات مجانية لتحويل النص إلى كلام مع وصول غير محدود بموجب سياسة الاستخدام العادل.


لماذا كان الذكاء الاصطناعي الصوتي عالي الجودة مكلفاً دائماً؟

إذا قضيت أي وقت في تقييم واجهات برمجة تطبيقات تحويل النص إلى كلام (TTS APIs)، فأنت تعرف النمط بالفعل: النماذج التي تبدو جيدة حقاً تكلف مالاً.

المستوى المجاني لـ ElevenLabs يمنحك 10,000 رصيد شهرياً (حوالي 6 - 10 دقائق) قبل أن تبدأ المطالبة بالدفع. أما OpenAI TTS فيعتمد على الدفع مقابل الاستخدام مع عدم وجود مستوى مجاني على الإطلاق. وأحدث نماذج Gemini TTS من Google — وهي الأكثر تقدماً لديهم — ليس لديها استخدام مجاني: أنت تدفع منذ أول رمز (token). هذا النمط متسق عبر الصناعة: جودة الصوت المتطورة كانت دائماً ميزة مدفوعة.

هذا يخلق مشكلة حقيقية للمطورين. سوق مولدات الصوت بالذكاء الاصطناعي ينمو بنسبة 20% سنوياً تقريباً — لكن الأدوات المخصصة لبناء منتجات تدعم الصوت ظلت وراء جدران الدفع. لا يمكنك تقييم نموذج بشكل صحيح بـ 10,000 رصيد فقط. ولا يمكنك بناء نموذج أولي لعميل صوتي، أو اختبار خط معالجة للكتب الصوتية، أو تجربة استنساخ الصوت دون الالتزام بميزانية مقدمة أو قضاء أسابيع في التعامل مع البدائل مفتوحة المصدر التي تتطلب بنية تحتية خاصة بك من وحدات معالجة الرسومات (GPU).

Fish Audio تغير ذلك اليوم.


ما هو S2.1 Pro؟

S2.1-Pro benchmark: throughput (tok/s) and TTFB p50 (ms) across concurrency levels from 1 to 512, showing 8,006 tok/s at c=64 and 73.2ms TTFB at c=1

S2.1 Pro هو نموذج الصوت المتطور الحالي من Fish Audio — أفضل نموذج لدينا، وهو متاح الآن لكل مطور مجاناً عبر API. إنه نموذج عصبي لتركيب الكلام مصمم لإنشاء أصوات ذكاء اصطناعي بجودة إنتاجية احترافية، مع نقاط قوة خاصة في البث منخفض زمن الوصول، وتحويل النص إلى كلام متعدد اللغات، واستنساخ الصوت. إنه يعتمد على أساس S2، الذي أصدرناه بأوزان مفتوحة في وقت سابق من هذا العام.

الأداء

  • معدل فوز 61% مقابل الجيل السابق S2 Pro في تقييمات الاستماع المباشرة — راجع مقارنة مزودي TTS العمياء الخاصة بنا للمزيد من التفاصيل.
  • ~70ms وقت استلام أول مقطع صوتي (TTFA) للطلب الواحد — بانخفاض من ~100ms في الجيل السابق.
  • تحسين الإنتاجية بأكثر من ضعفين تحت ضغط الطلبات المتزامنة العالية.

للاطلاع على الخلفية التقنية الكاملة، راجع ورقتنا البحثية: هنا

تغطية اللغات

يدعم S2.1 Pro 83 لغة، بما في ذلك الإنجليزية، اليابانية، الصينية، الكورية، الإسبانية، العربية، الفرنسية، الألمانية، البرتغالية، الروسية، وعشرات اللغات الأخرى. نفس النموذج يتعامل مع جميع اللغات — لا توجد نقاط نهاية منفصلة، ولا تسعير لكل لغة.

زمن الوصول

يوفر S2.1-Pro حوالي 90ms TTFA (وقت استلام أول مقطع صوتي) على واجهة برمجة التطبيقات القياسية، مما يجعله مناسباً لعملاء الصوت المباشر وأنظمة الحوار التفاعلية. إذا كنت بحاجة إلى تحكم دقيق في نبرة الكلام وأسلوب الإلقاء، فراجع أيضاً قدرات S2 في التحكم الصوتي على مستوى الكلمة.


لماذا يمكن لـ Fish Audio تقديم هذا مجاناً الآن؟

Fish Audio S2.1-Pro inference infrastructure: NVIDIA H200 with FP8 GEMM and custom scheduler delivering 125 audio tok/s per request (RTF 0.17) and ~70ms TTFA

باختصار: أعدنا بناء حزمة الاستدلال (inference stack) من الصفر، وانخفضت التكلفة لكل طلب بشكل ملحوظ لدرجة أننا نستطيع تحملها.

كيرنلات مخصصة لوحدات معالجة الرسومات (Custom GPU Kernels)

قمنا بتطوير fish-scales-ops، وهي مكتبة FP8 GEMM و FlashAttention بمستوى إنتاجي تستهدف معماريات NVIDIA Hopper (H100/H200) و Blackwell (RTX 6000 PRO). في عمليات فك التشفير المهمة لخدمات الذكاء الاصطناعي الصوتي، يتفوق مسار MXFP8 الخاص بنا على مرجع torch.compile-fused cuBLAS بنسبة 2.1–4.3 ضعفاً. لست بحاجة إلى فهم أي من هذا لاستخدام API — ولكنه السبب وراء استدامة المستوى المجاني.

إنتاجية أعلى

على وحدة H200 واحدة مع تكميم FP8، يحافظ النظام على إنتاجية مخرجات تتجاوز 8,000 رمز/ثانية عند 64 طلباً متزامناً. المزيد من الإنتاجية لكل GPU يعني معالجة المزيد من الطلبات لكل دولار، وهذا ما يجعل الوصول المجاني غير المحدود ممكناً اقتصادياً.


ماذا تعني كلمة "مجاني" فعلياً؟

نفضل أن نكون صريحين بشأن القيود بدلاً من إخفائها.

ما تحصل عليه:

  • سلسلة النموذج (Model string): s2.1-pro-free
  • وصول بحجم طلبات كبير بدون حد أقصى صارم للحروف (يخضع لسياسة الاستخدام العادل)
  • نفس نقطة نهاية API الخاصة بالخطط المدفوعة — لا يوجد تكامل منفصل

القيود الحالية:

  • المدة: الوصول المجاني متاح حتى 24 يوليو 2026. الوصول المجاني متاح حتى نهاية يوليو 2026. الوصول المجاني متاح حتى 31 أغسطس 2026. الوصول المجاني متاح حتى 30 نوفمبر 2026 — سنقوم بالإبلاغ عن أي تغييرات مع إشعار مسبق.
    • تحديث (يونيو 2026): سنقوم بتمديد الفترة المجانية لتشمل شهر يوليو بالكامل. نريد للمطورين أن يحصلوا على شهر كامل وغير منقطع للبناء والتقييم والإطلاق — وليس للعد التنازلي للموعد النهائي.
    • تحديث (يوليو 2026): سنقوم بتمديد الوصول المجاني مرة أخرى، حتى 31 أغسطس 2026. إن رؤية ما بناه مطورو Fish Audio باستخدام S2.1 Pro كان أمراً ملهماً حقاً، ونريد منح هذا الزخم مساحة أكبر للنمو.
  • لا توجد اتفاقية مستوى خدمة (SLA): لا توجد ضمانات لوقت التشغيل أو سرعة الاستجابة (TTFA)؛ صُمم هذا المستوى للتجريب وبناء النماذج الأولية.
  • لا يوجد ضمان لزمن الوصول: أفضل جهد ممكن، وليس تعاقدياً.
  • الاحتفاظ بالبيانات: قد تُستخدم الطلبات لتحسين جودة النموذج — راجع سياسة الخصوصية الخاصة بنا.
  • الاستخدام التجاري: قد تخضع بعض السيناريوهات التجارية لقيود. يجب على المنتجات التي تحقق أكثر من مليون دولار من الإيرادات السنوية المتكررة (ARR) الاتصال بنا قبل استخدام S2.1 Pro Free. راجع الأسعار وحدود المعدل للحصول على التفاصيل.

إذا كنت بحاجة إلى ضمانات SLA وزمن وصول للإنتاج، تتوفر خطط مدفوعة. هذا المستوى هو المكان المناسب للبناء والتقييم واتخاذ القرار.


كيفية استخدام API المجاني لتحويل النص إلى كلام: دليل البدء السريع لـ S2.1 Pro

احصل على مفتاح API الخاص بك من fish.audio/app/api-keys، ثم قم بإجراء أول استدعاء لك. يقبل Fish API الطلبات المشفرة بصيغة msgpack ويعيد الصوت بالتنسيق الذي تختاره. المرجع الكامل في وثائق API.

JavaScript

import { writeFile } from "fs/promises";

const body = {
  text: "Hello, world!",
  reference_id: "your_model_id",
  format: "mp3",
};

const res = await fetch("https://api.fish.audio/v1/tts", {
  method: "POST",
  headers: {
    Authorization: "Bearer <YOUR_API_KEY>",
    "Content-Type": "application/json",
    model: "s2.1-pro-free",
  },
  body: JSON.stringify(body),
});

if (!res.ok) {
  throw new Error(`TTS request failed: ${res.status} ${await res.text()}`);
}

const buffer = Buffer.from(await res.arrayBuffer());
await writeFile("output.mp3", buffer);

Python

import httpx

body = {
    "text": "Hello, world!",
    "reference_id": "your_model_id",
    "format": "mp3",
}

with httpx.Client() as client:
    res = client.post(
        "https://api.fish.audio/v1/tts",
        headers={
            "Authorization": "Bearer <YOUR_API_KEY>",
            "Content-Type": "application/json",
            "model": "s2.1-pro-free",
        },
        json=body,
    )

res.raise_for_status()

with open("output.mp3", "wb") as f:
    f.write(res.content)

التغيير الوحيد عن أي استدعاء آخر لـ Fish Audio API: قم بتعيين model: "s2.1-pro-free" في الترويسات (headers). هذا كل شيء.

احصل على مفتاح API المجاني الخاص بك ←


S2.1 Pro مقابل ElevenLabs وأفضل واجهات برمجة تطبيقات TTS في عام 2026

تعتمد معلومات المنافسين أدناه على الوثائق وصفحات الأسعار المتاحة للجمهور اعتباراً من يونيو 2026. قد تتغير الأسعار والميزات — يرجى التحقق مباشرة من كل مزود قبل اتخاذ قرار بشأن الإنتاج.

Comparison of free TTS APIs in 2026: Fish Audio S2.1-Pro vs ElevenLabs vs OpenAI TTS vs Google Cloud TTS

للحصول على تحليل مستقل أعمق، راجع مقارنة مزودي TTS العمياء الخاصة بنا.

الخلاصة: من بين مزودي واجهات برمجة تطبيقات TTS الرئيسيين الذين قمنا بتقييمهم، تقدم Fish Audio حالياً واحداً من أكثر نماذج الوصول المجاني سخاءً — وهو الوحيد الذي يشغل فيه المستوى المجاني نفس النموذج المتطور مثل المستوى المدفوع، دون حد استخدام صارم. المستوى المجاني لـ ElevenLabs هو فعلياً تجربة بـ 10,000 رصيد. أما Gemini TTS من Google فليس لديه مستوى مجاني على الإطلاق.

تبحث عن بديل مجاني لـ ElevenLabs لا يضحي بجودة النموذج؟ S2.1 Pro متاح الآن بدون حد استخدام.

تبحث عن بديل مجاني لـ OpenAI TTS؟ لا توفر OpenAI مستوى مجانياً لخدمة TTS — لذا يعد S2.1 Pro خياراً مقنعاً للتقييم أولاً.

شاهد وثائق API الكاملة وابدأ البناء ←


ما الذي يمكنك بناؤه باستخدامه؟

المستوى المجاني غير مقيد عمداً في حالات الاستخدام. إليك السيناريوهات التي يميل فيها مزيج S2.1 Pro من إنشاء أصوات الذكاء الاصطناعي منخفضة زمن الوصول ودعم تعدد اللغات واستنساخ الصوت إلى إحداث الفرق الأكبر.

عملاء الصوت (Voice Agents)

الذكاء الاصطناعي للمحادثات في الوقت الفعلي يعتمد بشكل كلي على زمن الوصول. مع سرعة استجابة تبلغ حوالي 90ms TTFA للمكالمات القياسية، فإن S2.1 Pro سريع بما يكفي لإجراء حوارات طبيعية متبادلة. ادمجه مع طبقة تحويل الكلام إلى نص وLLM للحصول على خط معالجة صوتي كامل دون فواتير لكل حرف. يمكنك أيضاً دمج S2.1 Pro في سير عمل الوكلاء عبر دعمنا لمهارات الوكيل وMCP.

الكتب الصوتية والسرد الطويل

دعم 83 لغة ونبرة الصوت الطبيعية تجعل S2.1 Pro مناسباً تماماً لإنتاج الكتب الصوتية وتركيب الكلام الطويل. الاستخدام غير المحدود يعني أنه يمكنك معالجة مخطوطات كاملة دون مراقبة عداد الحروف أو شراء أرصدة مسبقاً.

استنساخ الصوت (Voice Cloning)

يدعم S2.1 Pro استنساخ الصوت من صوت مرجعي عبر API — قم بتمرير عينة صوتية مرجعية وسيقوم النموذج بتركيب الكلام بهذا الصوت. قم ببناء تطبيقات صوتية مخصصة، أو ترجم المحتوى محلياً مع الحفاظ على هوية المتحدث، أو أنشئ أصوات شخصيات للألعاب والرسوم المتحركة. استنساخ الصوت متاح في المستوى المجاني، ويخضع لنفس سياسة الاستخدام العادل.

التطبيقات متعددة اللغات

إذا كان تطبيقك يخدم مستخدمين بلغات متعددة، فإن تغطية 83 لغة باستخدام واجهة برمجة تطبيقات صوتية موحدة ومتسقة تعد تبسيطاً كبيراً مقارنة بالبدائل التي تتطلب نقاط نهاية نماذج منفصلة لكل لغة أو تفرض أسعاراً مميزة لتركيب الكلام بغير الإنجليزية.

حوارات الشخصيات في الألعاب (NPC)

تستفيد خطوط معالجة الصوت في الألعاب من الإنتاجية العالية والتكلفة المتوقعة لكل طلب. الاستخدام المجاني غير المحدود يجعل من العملي إنشاء مكتبات حوار كبيرة والتكرار بحرية أثناء التطوير قبل الالتزام بميزانية الإنتاج.


متاح من خلال منظومة شركائنا

يتوفر S2.1 Pro أيضاً من خلال عدد متزايد من منصات الشركاء، بما في ذلك Runware، وRetell، وSierra، وغيرها.

إذا كنت تبني بالفعل على إحدى هذه المنصات، فيمكنك الوصول إلى S2.1 Pro دون تكامل أو إعداد إضافي — فقط استخدم ما لديك بالفعل.

نحن نعمل بنشاط على توسيع شبكة شركائنا. إذا كنت مزود منصة أو بنية تحتية ومهتماً بدمج S2.1 Pro، تواصل مع فريقنا لاستكشاف الإمكانيات.


الاستخدام العادل وما سيأتي لاحقاً

يعمل المستوى المجاني بموجب سياسة الاستخدام العادل. نحتفظ بالحق في تقييد أو تحديد الوصول لأنماط الاستخدام التي تبدو وكأنها إساءة استخدام بدلاً من تطوير — الهدف هو حماية الوصول لمجتمع المطورين بأكمله، وليس إنشاء حدود تعسفية لحالات الاستخدام المشروعة. راجع الأسعار وحدود المعدل للحصول على التفاصيل.

إليك بعض الأمور التي يجب توقعها:

  • الوصول المجاني متاح الآن لفترة أولية. سنقدم إشعاراً مسبقاً قبل حدوث أي تغيير.
  • الخطط المدفوعة مع ضمانات SLA، والتزامات زمن الوصول، والتراخيص التجارية متاحة لأعباء العمل الإنتاجية.
  • الاستثمار في البنية التحتية مستمر — العمل الهندسي الذي جعل هذا المستوى المجاني ممكناً ليس حدثاً لمرة واحدة.
  • بنية تحتية مفتوحة المصدر: نخطط لفتح مصدر مكونات البنية التحتية وراء S2.1 Pro — نفس الحزمة التقنية التي تجعل المستوى المجاني مستداماً.

إذا كنت تقيم Fish Audio للنشر في بيئة إنتاجية، فإن المستوى المجاني هو المكان المناسب للبدء. ابنِ شيئاً حقيقياً، وقس ما يهم لتطبيقك، وتواصل معنا عندما تكون مستعداً لمناقشة متطلبات الإنتاج.

لا حاجة لبطاقة ائتمان. لا توجد قائمة انتظار. لا حدود لما يمكنك تجربته.

احصل على مفتاح API المجاني الخاص بك ←

الأسئلة المتكررة

ما هي واجهة برمجة تطبيقات تحويل النص إلى كلام (TTS API)؟
واجهة برمجة تطبيقات تحويل النص إلى كلام (TTS API) هي خدمة ويب تقوم بتحويل النص المكتوب إلى صوت منطوق. يرسل المطورون سلسلة نصية إلى نقطة نهاية API ويتلقون ملفاً صوتياً — عادةً بصيغة MP3 أو WAV أو Opus — يمكن تشغيله في التطبيقات أو تخزينه أو بثه في الوقت الفعلي. تستخدم واجهات برمجة تطبيقات الصوت المتقدمة بالذكاء الاصطناعي مثل S2.1 Pro نماذج تركيب كلام عصبية لإنتاج صوت يبدو طبيعياً ويصعب تمييزه عن الكلام البشري.
هل Fish Audio S2.1 Pro مجاني حقاً؟
نعم. يتوفر S2.1 Pro بدون تكلفة عبر Fish API باستخدام سلسلة النموذج `s2.1-pro-free`. لا يوجد حد أقصى صارم للحروف — يخضع الاستخدام لسياسة الاستخدام العادل لمنع إساءة الاستخدام. المستوى المجاني ليس له اتفاقية مستوى خدمة (SLA) ولا ضمان لزمن الوصول، وقد يتم الاحتفاظ بالطلبات لتحسين النموذج. إنه مصمم للتطوير والنماذج الأولية والتقييم. راجع [الأسعار وحدود المعدل](https://docs.fish.audio/developer-guide/models-pricing/pricing-and-rate-limits) للحصول على التفاصيل الكاملة.
ما هي أفضل واجهة برمجة تطبيقات TTS مجانية في عام 2026؟
تعتمد أفضل واجهة برمجة تطبيقات TTS مجانية على حالة استخدامك. من بين المزودين الرئيسيين: تقدم Fish Audio S2.1 Pro وصولاً مجانياً سخياً لنموذج من الجيل الحالي، بدون حد استخدام صارم ودعم لـ 83 لغة. توفر ElevenLabs 10,000 رصيد مجاني شهرياً مع إمكانية الوصول إلى مكتبة أصواتها. أصوات WaveNet القديمة من Google مجانية حتى 4 ملايين حرف شهرياً. أما OpenAI TTS و Gemini TTS الأحدث من Google فليس لديهما مستوى مجاني. للمطورين الذين يرغبون في تقييم API صوتي متطور دون قيود ميزانية، يعد S2.1 Pro نقطة انطلاق قوية.
كيف تقارن Fish Audio بـ ElevenLabs؟
تقدم كل من Fish Audio و ElevenLabs توليداً صوتياً عصبياً واستنساخاً للصوت بجودة عالية. الاختلافات العملية الرئيسية في المستوى المجاني: المستوى المجاني في Fish Audio يشغل نفس نموذج S2.1 Pro مثل المستوى المدفوع بدون حد استخدام صارم؛ بينما يقتصر المستوى المجاني في ElevenLabs على 10,000 رصيد شهرياً. من حيث تغطية اللغات، تدعم Fish Audio حوالي 83 لغة مقابل 70+ في ElevenLabs. تمتلك ElevenLabs مكتبة أكبر من الأصوات الجاهزة ومنظومة محتوى إبداعي أكثر رسوخاً. تميل Fish Audio لتكون أقوى في حالات الاستخدام الموجهة للمطورين التي تتطلب زمن وصول منخفض، أو تزامن طلبات عالٍ، أو دعماً لعدة لغات. راجع [مقارنة TTS العمياء](https://fish.audio/blog/blind-tts-provider-comparison-2026/) الخاصة بنا للحصول على معيار مستقل.
هل تدعم Fish Audio استنساخ الصوت؟
نعم. يدعم S2.1 Pro [استنساخ الصوت من صوت مرجعي](https://docs.fish.audio/features/voice-cloning). يمكنك تمرير عينة صوتية مرجعية وسيقوم النموذج بتركيب الكلام بهذا الصوت. يعمل هذا عبر جميع اللغات الـ 83 المدعومة، مما يجعله مفيداً بشكل خاص لترجمة المحتوى محلياً حيث يكون ثبات هوية المتحدث أمراً بالغ الأهمية. يعد نظام استنساخ الصوت لدينا واحداً من الأقوى في فئته، حيث يوفر ثباتاً عالياً للمتحدث، ونبرة كلام طبيعية، وأداءً مستقراً عبر اللغات واللكنات. استنساخ الصوت متاح في المستوى المجاني، ويخضع لنفس سياسة الاستخدام العادل مثل جميع استخدامات s2.1-pro-free الأخرى.
هل يمكنني استخدام Fish Audio تجارياً؟
قد يواجه المستوى المجاني (`s2.1-pro-free`) قيوداً في بعض السيناريوهات التجارية. للاستخدام التجاري في الإنتاج مع ترخيص كامل وSLA وعدم الاحتفاظ بالبيانات، يرجى الرجوع إلى خطط Fish Audio المدفوعة. راجع [الأسعار وحدود المعدل](https://docs.fish.audio/developer-guide/models-pricing/pricing-and-rate-limits) و[شروط الخدمة](https://fish.audio/terms/) للتعرف على السياسة الحالية.
ما هي اللغات التي تدعمها Fish Audio؟
يدعم S2.1 Pro نحو 83 لغة، بما في ذلك العربية، الإنجليزية، اليابانية، الكورية، الصينية، الإسبانية، البرتغالية، الفرنسية، الألمانية، الروسية، الإيطالية، التركية، الهولندية، البولندية، الفيتنامية، التايلاندية، الإندونيسية، وغيرها الكثير. يتم تقديم جميع اللغات بواسطة نفس النموذج — لا توجد نقاط نهاية منفصلة أو مستويات تسعير خاصة بكل لغة.
Shijia Liao

Shijia LiaoX

Founder & Chief-Scientist of Fish Audio.

اقرأ المزيد من Shijia Liao

أنشئ أصواتًا تبدو حقيقية

ابدأ في إنشاء أعلى جودة صوت اليوم

هل لديك حساب بالفعل؟ تسجيل الدخول