Fish Audio S2.1 Pro: واجهة برمجة تطبيقات مجانية لتحويل النص إلى كلام للمطورين
ملخص سريع:
S2.1 Pro، أحدث نموذج صوتي من Fish Audio، متاح الآن كواجهة برمجة تطبيقات (API) مجانية لتحويل النص إلى كلام
83 لغة، استخدام غير محدود بموجب سياسة الاستخدام العادل
اسم النموذج: s2.1-pro-free — أضفه ببساطة إلى طلبات Fish API الحالية
جرب S2.1 Pro مجانًا — أول صوت خلال 5 دقائق ←
يونيو 2026 | أصبح نموذج S2.1 Pro من Fish Audio متاحاً الآن كواجهة برمجة تطبيقات مجانية لتحويل النص إلى كلام مع وصول غير محدود بموجب سياسة الاستخدام العادل.
لماذا كان الذكاء الاصطناعي الصوتي عالي الجودة مكلفاً دائماً
إذا كنت قد قضيت أي وقت في تقييم واجهات برمجة تطبيقات تحويل النص إلى كلام، فأنت تعرف النمط بالفعل: النماذج التي تبدو جيدة حقاً تكلف مالاً.
تمنحك الخطة المجانية من ElevenLabs حوالي 10,000 رصيد شهرياً (حوالي 6 - 10 دقائق) قبل أن تظهر لك مطالبة الدفع. أما OpenAI TTS فهو بنظام الدفع حسب الاستخدام ولا توجد خطة مجانية على الإطلاق. وأحدث نماذج Gemini TTS من Google — وهي الأكثر تقدماً لديهم — ليس لها استخدام مجاني: تدفع منذ أول رمز (token). هذا النمط متسق في جميع أنحاء الصناعة: لطالما كانت جودة الصوت المتطورة ميزة مدفوعة.
يخلق هذا مشكلة حقيقية للمطورين. ينمو سوق مولدات الصوت بالذكاء الاصطناعي بنسبة تقارب 20% سنوياً — لكن الأدوات المتاحة لبناء منتجات تدعم الصوت ظلت خلف جدران الدفع. لا يمكنك تقييم نموذج بشكل صحيح بـ 10,000 رصيد فقط. لا يمكنك بناء نموذج أولي لوكيل صوتي، أو اختبار نظام إنتاج الكتب الصوتية، أو التجربة في استنساخ الصوت دون الالتزام بميزانية مسبقة أو قضاء أسابيع في صراع مع البدائل مفتوحة المصدر التي تتطلب بنية تحتية خاصة بك لوحدات معالجة الرسومات (GPU).
تغير Fish Audio هذا الواقع اليوم.
ما هو S2.1 Pro؟
S2.1 Pro هو أحدث نموذج صوتي متطور من Fish Audio حالياً — وهو أفضل نموذج لدينا، ومتاح الآن لكل مطور مجاناً عبر واجهة برمجة التطبيقات. إنه نموذج تأليف كلام عصبي مصمم لتوليد صوت بالذكاء الاصطناعي بجودة إنتاجية، مع نقاط قوة خاصة في البث منخفض زمن الاستجابة، والتحويل متعدد اللغات، واستنساخ الصوت. يعتمد النموذج على أساس S2، الذي أصدرناه بأوزان مفتوحة في وقت سابق من هذا العام.
الأداء
- معدل فوز 61% مقارنة بالجيل السابق S2 Pro في تقييمات الاستماع المباشرة — راجع مقارنة مزودي TTS العمياء لمزيد من السياق
- ~70ms زمن الوصول لأول صوت (TTFA) في الطلب الواحد — انخفاضاً من ~100ms في الجيل السابق
- تحسن بنسبة 2x+ في الإنتاجية تحت أحمال الاستخدام المتزامن العالية
للاطلاع على الخلفية التقنية الكاملة، راجع ورقتنا البحثية: هنا
تغطية اللغات
يدعم S2.1 Pro 83 لغة، بما في ذلك الإنجليزية، واليابانية، والصينية، والكورية، والإسبانية، والعربية، والفرنسية، والألمانية، والبرتغالية، والروسية، وعشرات اللغات الأخرى. نفس النموذج يتعامل مع جميع اللغات — لا توجد نقاط نهاية منفصلة، ولا تسعير خاص بكل لغة.
زمن الاستجابة (Latency)
يوفر S2.1-Pro حوالي 90ms كزمن وصول لأول صوت (TTFA) على الواجهة القياسية، مما يجعله قابلاً للاستخدام في الوكلاء الصوتيين المباشرين وأنظمة الحوار التفاعلية. إذا كنت بحاجة إلى تحكم دقيق في نبرة الكلام وأسلوب الإلقاء، فراجع أيضاً قدرات التحكم الصوتي على مستوى الكلمة في S2.
لماذا يمكن لـ Fish Audio تقديم هذا مجاناً الآن
باختصار: قمنا بإعادة بناء بنية الاستدلال (inference stack) من الصفر، وانخفضت التكلفة لكل طلب بشكل كبير بما يكفي لنتمكن من تحملها.
نوى GPU مخصصة (Custom GPU Kernels)
قمنا بتطوير fish-scales-ops، وهي مكتبة FP8 GEMM و FlashAttention بجودة إنتاجية تستهدف معمارية NVIDIA Hopper (H100/H200) و Blackwell (RTX 6000 PRO). في أشكال فك التشفير التي تهم تشغيل الذكاء الاصطناعي الصوتي، يتفوق مسار MXFP8 الخاص بنا على مرجع torch.compile-fused cuBLAS بنسبة 2.1–4.3 ضعفاً. لا تحتاج إلى فهم أي من هذا لاستخدام واجهة برمجة التطبيقات — ولكن هذا هو السبب في أن الخطة المجانية مستدامة.
إنتاجية أعلى
على معالج H200 واحد مع تكميم FP8، يحافظ النظام على إنتاجية مخرجات تزيد عن 8,000 رمز/ثانية عند 64 طلباً متزامناً. المزيد من الإنتاجية لكل وحدة معالجة رسومات يعني خدمة المزيد من الطلبات مقابل كل دولار، وهذا ما يجعل الوصول المجاني غير المحدود ممكناً اقتصادياً.
ماذا يعني "مجاني" بالفعل
نحن نفضل أن نكون صريحين بشأن القيود بدلاً من إخفائها.
ما ستحصل عليه:
- اسم النموذج:
s2.1-pro-free - وصول بحجم كبير بدون سقف محدد لعدد الحروف (يخضع لسياسة الاستخدام العادل)
- نفس نقطة نهاية API الخاصة بالخطط المدفوعة — لا يوجد تكامل منفصل
القيود الحالية:
- المدة:
الوصول المجاني متاح حتى 24 يوليو 2026 الوصول المجاني متاح حتى نهاية يوليو 2026الوصول المجاني متاح حتى 31 أغسطس 2026 — سنقوم بالإبلاغ عن أي تغييرات بإشعار مسبق.- تحديث (يونيو 2026): نقوم بتمديد الفترة المجانية لتشمل شهر يوليو بالكامل. نريد للمطورين أن يحصلوا على شهر كامل من البناء والتقييم والإطلاق دون انقطاع — وليس مجرد عد تنازلي لموعد نهائي.
- تحديث (يوليو 2026): نقوم بتمديد الوصول المجاني مرة أخرى حتى 31 أغسطس 2026. لقد كان من الملهم حقاً رؤية ما بناه مطورو Fish Audio باستخدام S2.1 Pro، ونريد منح هذا الزخم مساحة أكبر للنمو.
- لا يوجد اتفاق مستوى خدمة (SLA): لا توجد ضمانات لوقت التشغيل أو زمن الوصول؛ النموذج مصمم للتجربة وبناء النماذج الأولية.
- لا يوجد ضمان لزمن الاستجابة: يعتمد على أفضل الجهود، وليس تعاقدياً.
- الاحتفاظ بالبيانات: قد تُستخدم الطلبات لتحسين جودة النموذج — راجع سياسة الخصوصية الخاصة بنا.
- الاستخدام التجاري: قد تكون هناك قيود على بعض السيناريوهات التجارية. يجب على المنتجات التي تحقق عوائد سنوية متكررة (ARR) تزيد عن مليون دولار التواصل معنا قبل استخدام S2.1 Pro Free. راجع الأسعار وحدود المعدل لمزيد من التفاصيل.
إذا كنت بحاجة إلى ضمانات إنتاجية لاتفاق مستوى الخدمة وزمن الاستجابة، فالخطط المدفوعة متاحة. هذه الخطة هي المكان المناسب للبناء والتقييم واتخاذ القرار.
كيفية استخدام API المجاني لتحويل النص إلى كلام: دليل سريع لـ S2.1 Pro
احصل على مفتاح API الخاص بك من fish.audio/app/api-keys، ثم قم بإجراء طلبك الأول. تقبل Fish API الطلبات المشفرة بصيغة msgpack وتعيد الصوت بالتنسيق الذي تختاره. المرجع الكامل في توثيق API.
JavaScript
import { writeFile } from "fs/promises";
const body = {
text: "مرحباً بالعالم!",
reference_id: "your_model_id",
format: "mp3",
};
const res = await fetch("https://api.fish.audio/v1/tts", {
method: "POST",
headers: {
Authorization: "Bearer <YOUR_API_KEY>",
"Content-Type": "application/json",
model: "s2.1-pro-free",
},
body: JSON.stringify(body),
});
if (!res.ok) {
throw new Error(`TTS request failed: ${res.status} ${await res.text()}`);
}
const buffer = Buffer.from(await res.arrayBuffer());
await writeFile("output.mp3", buffer);
Python
import httpx
body = {
"text": "مرحباً بالعالم!",
"reference_id": "your_model_id",
"format": "mp3",
}
with httpx.Client() as client:
res = client.post(
"https://api.fish.audio/v1/tts",
headers={
"Authorization": "Bearer <YOUR_API_KEY>",
"Content-Type": "application/json",
"model": "s2.1-pro-free",
},
json=body,
)
res.raise_for_status()
with open("output.mp3", "wb") as f:
f.write(res.content)
التغيير الوحيد عن أي طلب Fish Audio API آخر: قم بتعيين model: "s2.1-pro-free" في الترويسات (headers). هذا كل شيء.
احصل على مفتاح API المجاني الخاص بك ←
S2.1 Pro مقابل ElevenLabs وأفضل واجهات برمجة تطبيقات TTS في عام 2026
معلومات المنافسين أدناه مستندة إلى التوثيق المتاح علناً وصفحات التسعير اعتباراً من يونيو 2026. قد تتغير الأسعار والميزات — يرجى التحقق مباشرة من كل مزود قبل اتخاذ قرار الإنتاج.
للحصول على تحليل مستقل أعمق، راجع مقارنة مزودي TTS العمياء.
الخلاصة: من بين مزودي واجهات برمجة تطبيقات TTS الرئيسيين الذين قمنا بتقييمهم، تقدم Fish Audio حالياً أحد أكثر نماذج الوصول المجاني سخاءً — والوحيد الذي تشغل فيه الخطة المجانية نفس النموذج المتطور الذي تشغله الخطة المدفوعة، وبدون سقف استخدام صارم. الخطة المجانية لـ ElevenLabs هي فعلياً تجريبية بـ 10,000 رصيد. أما أحدث TTS من Google (Gemini TTS) فلا توجد له خطة مجانية على الإطلاق.
هل تبحث عن بديل مجاني لـ ElevenLabs لا يساوم على جودة النموذج؟ S2.1 Pro متاح الآن بدون سقف استخدام.
هل تبحث عن بديل مجاني لـ OpenAI TTS؟ عرض TTS من OpenAI لا يحتوي على خطة مجانية — S2.1 Pro هو خيار مقنع للتقييم أولاً.
راجع وثائق API الكاملة وابدأ البناء ←
ماذا يمكنك أن تبني باستخدامه
الخطة المجانية غير مقيدة عمداً في حالات الاستخدام. إليك السيناريوهات التي تميل فيها تركيبة S2.1 Pro من توليد الصوت بالذكاء الاصطناعي منخفض زمن الاستجابة، والدعم متعدد اللغات، واستنساخ الصوت، إلى إحداث الفرق الأكبر.
الوكلاء الصوتيون
يعتمد نجاح الذكاء الاصطناعي الحواري في الوقت الفعلي على زمن الاستجابة. عند حوالي 90ms TTFA للمكالمات القياسية، فإن S2.1 Pro سريع بما يكفي لحوار طبيعي متبادل الأدوار. ادمجه مع طبقة تحويل الكلام إلى نص ونموذج لغة كبير (LLM) للحصول على خط إنتاج صوتي كامل بدون فاتورة لكل حرف. يمكنك أيضاً دمج S2.1 Pro في سير عمل الوكلاء عبر دعمنا لـ MCP ومهارات الوكلاء.
الكتب الصوتية والسرد الطويل
دعم 83 لغة ونبرة الكلام الطبيعية تجعل S2.1 Pro مناسباً جداً لإنتاج الكتب الصوتية وتأليف الكلام طويل المدى. الاستخدام غير المحدود يعني أنه يمكنك معالجة مخطوطات كاملة دون مراقبة عداد الحروف أو الشراء المسبق للأرصدة.
استنساخ الصوت
يدعم S2.1 Pro استنساخ الصوت من عينة صوتية مرجعية عبر واجهة برمجة التطبيقات — مرر عينة صوتية مرجعية وسيقوم النموذج بتأليف الكلام بذلك الصوت. قم ببناء تطبيقات صوتية مخصصة، أو توطين المحتوى مع الحفاظ على هوية المتحدث، أو توليد أصوات شخصيات للألعاب والرسوم المتحركة. استنساخ الصوت متاح في الخطة المجانية، ويخضع لنفس سياسة الاستخدام العادل.
التطبيقات متعددة اللغات
إذا كان تطبيقك يخدم مستخدمين بلغات متعددة، فإن تغطية 83 لغة عبر واجهة برمجة تطبيقات واحدة متسقة للذكاء الاصطناعي الصوتي هي تبسيط كبير مقارنة بالبدائل التي تتطلب نقاط نهاية منفصلة لكل لغة أو تفرض أسعاراً مرتفعة لتأليف الكلام بغير الإنجليزية.
حوارات الشخصيات (NPC) في الألعاب
تستفيد خطوط إنتاج أصوات الألعاب من الإنتاجية العالية والتكلفة المتوقعة لكل طلب. الاستخدام المجاني غير المحدود يجعل من العملي توليد مكتبات حوارات كبيرة والتجربة بحرية أثناء التطوير قبل الالتزام بميزانية إنتاجية.
متاح عبر شبكة شركائنا
يتوفر S2.1 Pro أيضاً عبر عدد متزايد من منصات الشركاء، بما في ذلك Runware، و Retell، و Sierra، وغيرها.
إذا كنت تبني بالفعل على إحدى هذه المنصات، فيمكنك الوصول إلى S2.1 Pro دون أي تكامل أو إعداد إضافي — فقط استخدم ما لديك بالفعل.
نحن نعمل بنشاط على توسيع شبكة الشركاء. إذا كنت مزود منصة أو بنية تحتية وتهتم بدمج S2.1 Pro، تواصل مع فريقنا لاستكشاف الإمكانيات.
الاستخدام العادل وما القادم
تعمل الخطة المجانية بموجب سياسة الاستخدام العادل. نحن نحتفظ بالحق في تقييد الوصول للأنماط التي تبدو وكأنها إساءة استخدام بدلاً من التطوير — الهدف هو حماية الوصول لجميع مجتمع المطورين، وليس إنشاء حدود تعسفية لحالات الاستخدام المشروعة. راجع الأسعار وحدود المعدل لمزيد من التفاصيل.
إليك بعض الأشياء التي يمكنك توقعها:
- الوصول المجاني متاح الآن لفترة أولية. سنقدم إشعاراً مسبقاً قبل حدوث أي تغيير.
- الخطط المدفوعة مع ضمانات اتفاق مستوى الخدمة، وزمن الاستجابة، والتراخيص التجارية متاحة لأحمال العمل الإنتاجية.
- الاستثمار في البنية التحتية مستمر — العمل الهندسي الذي جعل هذه الخطة المجانية ممكنة ليس حدثاً لمرة واحدة.
- بنية تحتية مفتوحة المصدر: نخطط لفتح مصدر مكونات البنية التحتية خلف S2.1 Pro — نفس التكنولوجيا التي تجعل الخطة المجانية مستدامة.
إذا كنت تقيم Fish Audio للنشر الإنتاجي، فإن الخطة المجانية هي المكان المناسب للبدء. ابنِ شيئاً حقيقياً، وقس ما يهم لتطبيقك، وتواصل معنا عندما تكون مستعداً لمناقشة متطلبات الإنتاج.
لا حاجة لبطاقة ائتمان. لا توجد قائمة انتظار. لا حدود لما يمكنك تجربته.

