Un an.

52M$ de seed.

8M+ créateurs.

Notre histoire
23 juin 2026Recherche

Fish Audio S2.1 Pro : API de synthèse vocale gratuite pour les développeurs

Fish Audio S2.1 Pro : API de synthèse vocale gratuite pour les développeurs

Résumé rapide :

  • S2.1 Pro, le modèle de voix le plus avancé de Fish Audio, est désormais disponible via une API de synthèse vocale gratuite.

  • 83 langues, usage illimité selon la Politique d'Utilisation Équitable (Fair Use Policy).

  • Identifiant du modèle : s2.1-pro-free — intégrez-le directement dans vos appels Fish API existants.

Essayez S2.1 Pro gratuitement — premier audio en 5 minutes →

Juin 2026 | Le modèle S2.1 Pro de Fish Audio est maintenant disponible sous forme d'API de synthèse vocale (TTS) gratuite avec un accès illimité dans le cadre d'une utilisation équitable.


Pourquoi l'IA vocale de haute qualité a toujours été coûteuse

Si vous avez déjà évalué des API de synthèse vocale, vous connaissez déjà le refrain : les modèles qui sonnent vraiment bien coûtent cher.

L'offre gratuite d'ElevenLabs vous donne 10 000 crédits par mois (environ 6 à 10 minutes) avant que la barrière de paiement ne s'active. OpenAI TTS fonctionne au paiement à l'usage sans aucune offre gratuite. Les derniers modèles Gemini TTS de Google — leurs plus avancés — n'offrent aucun usage gratuit : vous payez dès le premier jeton. Le schéma est constant dans toute l'industrie : la qualité vocale de pointe est une fonctionnalité payante.

Cela crée un réel problème pour les développeurs. Le marché des générateurs de voix par IA croît de près de 20 % par an — mais les outils pour créer des produits vocaux sont restés derrière des murs de paiement. Vous ne pouvez pas évaluer correctement un modèle avec 10 000 crédits. Vous ne pouvez pas prototyper un agent vocal, tester un pipeline de livre audio ou expérimenter le clonage de voix sans engager un budget au préalable ou passer des semaines à lutter avec des alternatives open-source nécessitant votre propre infrastructure GPU.

Fish Audio change cela aujourd'hui.


Qu'est-ce que S2.1 Pro ?

Benchmark S2.1-Pro : débit (tok/s) et TTFB p50 (ms) à travers différents niveaux de concurrence de 1 à 512, montrant 8 006 tok/s à c=64 et 73,2ms de TTFB à c=1

S2.1 Pro est le modèle vocal actuel à la pointe de la technologie de Fish Audio — le meilleur modèle que nous ayons, désormais disponible gratuitement pour chaque développeur via API. C'est un modèle de synthèse vocale neuronale conçu pour la génération de voix par IA de qualité production, avec des points forts particuliers dans le streaming à faible latence, le TTS multilingue et le clonage de voix. Il s'appuie sur les bases de S2, que nous avons publié en open-weights plus tôt cette année.

Performance

  • Taux de victoire de 61 % par rapport à la génération précédente S2 Pro lors d'évaluations d'écoute comparatives — consultez notre comparaison d'écoute à l'aveugle pour plus de contexte.
  • Délai avant le premier audio (TTFA) d'environ 70ms pour une requête unique — contre environ 100ms pour la génération précédente.
  • Amélioration du débit de plus de 2x sous une charge de concurrence élevée.

Pour le contexte technique complet, consultez notre article de recherche : Ici

Couverture linguistique

S2.1 Pro prend en charge 83 langues, dont l'anglais, le japonais, le chinois, le coréen, l'espagnol, l'arabe, le français, l'allemand, le portugais, le russe et des dizaines d'autres. Le même modèle gère toutes les langues — pas de points de terminaison séparés, pas de tarification par langue.

Latence

S2.1-Pro offre un TTFA d'environ 90ms sur l'API standard, ce qui le rend viable pour les agents vocaux en direct et les systèmes de dialogue interactifs. Si vous avez besoin d'un contrôle précis sur la prosodie et l'élocution, consultez également les capacités de contrôle vocal au niveau du mot de S2.


Pourquoi Fish Audio peut proposer cela gratuitement maintenant

Infrastructure d'inférence Fish Audio S2.1-Pro : NVIDIA H200 avec FP8 GEMM et planificateur personnalisé délivrant 125 audio tok/s par requête (RTF 0.17) et ~70ms de TTFA

La version courte : nous avons reconstruit la pile d'inférence de zéro, et le coût par requête a suffisamment baissé pour que nous puissions l'absorber.

Kernels GPU personnalisés

Nous avons développé fish-scales-ops, une bibliothèque FP8 GEMM et FlashAttention de qualité production ciblant les architectures NVIDIA Hopper (H100/H200) et Blackwell (RTX 6000 PRO). Sur les formats de décodage qui comptent pour le service de l'IA vocale, notre chemin MXFP8 surpasse la référence cuBLAS fusionnée par torch.compile de 2,1 à 4,3×. Vous n'avez pas besoin de comprendre tout cela pour utiliser l'API — mais c'est la raison pour laquelle le niveau gratuit est viable.

Débit plus élevé

Sur un seul H200 avec quantification FP8, le système maintient un débit de sortie de plus de 8 000 jetons/seconde avec 64 requêtes simultanées. Plus de débit par GPU signifie plus de requêtes servies par dollar investi, ce qui rend l'accès gratuit illimité économiquement possible.


Ce que "gratuit" signifie réellement

Nous préférons être transparents sur les contraintes plutôt que de les cacher.

Ce que vous obtenez :

  • Identifiant du modèle : s2.1-pro-free
  • Accès à haut volume sans limite stricte de caractères (sous réserve de la Politique d'Utilisation Équitable)
  • Même point de terminaison API que les plans payants — pas d'intégration séparée

Limitations actuelles :

  • Durée : L'accès gratuit est disponible jusqu'au 24 juillet 2026 L'accès gratuit est disponible jusqu'à la fin de juillet 2026 L'accès gratuit est disponible jusqu'au 31 août 2026 — nous communiquerons tout changement avec un préavis.
    • Mise à jour (juin 2026) : Nous prolongeons la fenêtre de gratuité pour couvrir tout le mois de juillet. Nous voulons que les développeurs aient un mois complet et ininterrompu pour construire, évaluer et déployer — sans avoir à compter les jours.
    • Mise à jour (juillet 2026) : Nous prolongeons l'accès gratuit une fois de plus, jusqu'au 31 août 2026. Voir ce que nos développeurs Fish ont construit avec S2.1 Pro a été véritablement encourageant, et nous voulons donner à cet élan encore plus d'espace pour croître.
  • Pas de SLA : Aucune garantie de disponibilité ou de TTFA ; conçu pour l'expérimentation et le prototypage.
  • Pas de garantie de latence : Service au mieux (best-effort), non contractuel.
  • Rétention des données : Les requêtes peuvent être utilisées pour améliorer la qualité du modèle — consultez notre Politique de Confidentialité.
  • Usage commercial : Certains scénarios commerciaux peuvent comporter des restrictions. Les produits générant plus de 1 million de dollars de revenus annuels récurrents (ARR) doivent nous contacter avant d'utiliser S2.1 Pro Free. Consultez Tarification et limites de débit pour plus de détails.

Si vous avez besoin d'un SLA de production et de garanties de latence, des plans payants sont disponibles. Ce niveau gratuit est l'endroit idéal pour construire, évaluer et décider.


Comment utiliser l'API de synthèse vocale gratuite : Guide de démarrage S2.1 Pro

Obtenez votre clé API sur fish.audio/app/api-keys, puis effectuez votre premier appel. L'API Fish accepte des requêtes encodées en msgpack et renvoie l'audio dans le format de votre choix. Référence complète dans la documentation de l'API.

JavaScript

import { writeFile } from "fs/promises";

const body = {
  text: "Bonjour le monde !",
  reference_id: "votre_id_de_modele",
  format: "mp3",
};

const res = await fetch("https://api.fish.audio/v1/tts", {
  method: "POST",
  headers: {
    Authorization: "Bearer <VOTRE_CLÉ_API>",
    "Content-Type": "application/json",
    model: "s2.1-pro-free",
  },
  body: JSON.stringify(body),
});

if (!res.ok) {
  throw new Error(`La requête TTS a échoué : ${res.status} ${await res.text()}`);
}

const buffer = Buffer.from(await res.arrayBuffer());
await writeFile("output.mp3", buffer);

Python

import httpx

body = {
    "text": "Bonjour le monde !",
    "reference_id": "votre_id_de_modele",
    "format": "mp3",
}

with httpx.Client() as client:
    res = client.post(
        "https://api.fish.audio/v1/tts",
        headers={
            "Authorization": "Bearer <VOTRE_CLÉ_API>",
            "Content-Type": "application/json",
            "model": "s2.1-pro-free",
        },
        json=body,
    )

res.raise_for_status()

with open("output.mp3", "wb") as f:
    f.write(res.content)

Le seul changement par rapport à tout autre appel API Fish Audio : définissez model: "s2.1-pro-free" dans les en-têtes. C'est tout.

Obtenez votre clé API gratuite →


S2.1 Pro vs ElevenLabs et les meilleures API TTS en 2026

Les informations sur les concurrents ci-dessous sont basées sur la documentation publique et les pages de tarification disponibles en juin 2026. Les tarifs et fonctionnalités peuvent changer — vérifiez directement auprès de chaque fournisseur avant de prendre une décision de production.

Comparaison des API TTS gratuites en 2026 : Fish Audio S2.1-Pro vs ElevenLabs vs OpenAI TTS vs Google Cloud TTS

Pour une analyse indépendante plus approfondie, consultez notre comparaison d'écoute à l'aveugle des fournisseurs TTS.

En résumé : Parmi les principaux fournisseurs d'API TTS que nous avons évalués, Fish Audio offre actuellement l'un des modèles d'accès gratuit les plus généreux — le seul où le niveau gratuit utilise le même modèle de pointe que le niveau payant, sans limite d'usage stricte. Le niveau gratuit d'ElevenLabs est en pratique un essai limité à 10 000 crédits. Le TTS le plus avancé de Google (Gemini TTS) n'a aucun niveau gratuit.

Vous cherchez une alternative gratuite à ElevenLabs qui ne fait pas de compromis sur la qualité du modèle ? S2.1 Pro est disponible dès maintenant sans limite d'usage.

Vous cherchez une alternative gratuite à OpenAI TTS ? L'offre TTS d'OpenAI n'a pas de niveau gratuit — S2.1 Pro est une option convaincante à évaluer en priorité.

Voir la doc API complète et commencer à construire →


Ce que vous pouvez construire avec

Le niveau gratuit est intentionnellement sans restriction sur les cas d'utilisation. Voici les scénarios où la combinaison de génération de voix par IA à faible latence, de support multilingue et de clonage de voix de S2.1 Pro a tendance à faire la plus grande différence.

Agents Vocaux

L'IA conversationnelle en temps réel dépend entièrement de la latence. Avec un TTFA d'environ 90ms pour les appels standards, S2.1 Pro est assez rapide pour un dialogue naturel. Associez-le à une couche de reconnaissance vocale (STT) et à un LLM pour un pipeline vocal complet sans facturation au caractère. Vous pouvez également intégrer S2.1 Pro dans les flux d'agents via notre support MCP et compétences d'agent.

Livres audio et narration longue durée

Le support de 83 langues et une prosodie naturelle rendent S2.1 Pro idéal pour la production de livres audio et la synthèse vocale longue durée. L'usage illimité signifie que vous pouvez traiter des manuscrits complets sans surveiller un compteur de caractères ou pré-acheter des crédits.

Clonage de voix

S2.1 Pro prend en charge le clonage de voix à partir d'un audio de référence via API — transmettez un échantillon audio de référence et le modèle synthétise la parole avec cette voix. Créez des applications vocales personnalisées, localisez du contenu avec une identité de locuteur cohérente ou générez des voix de personnages pour les jeux et l'animation. Le clonage de voix est disponible sur le niveau gratuit, soumis à la même Politique d'Utilisation Équitable.

Applications multilingues

Si votre application s'adresse à des utilisateurs dans plusieurs langues, la couverture de 83 langues avec une seule API vocale IA cohérente est une simplification significative par rapport aux alternatives qui nécessitent des points de terminaison de modèles séparés par langue ou facturent des tarifs premium pour la synthèse vocale non-anglaise.

Dialogues de PNJ de jeux vidéo

Les pipelines audio de jeux bénéficient d'un débit élevé et d'un coût par requête prévisible. L'usage gratuit illimité rend pratique la génération de grandes bibliothèques de dialogues et l'itération libre pendant le développement avant de s'engager sur un budget de production.


Disponible via notre écosystème de partenaires

S2.1 Pro est également disponible via un nombre croissant de plateformes partenaires, notamment Runware, Retell, Sierra, et d'autres.

Si vous développez déjà sur l'une de ces plateformes, S2.1 Pro est accessible sans intégration ni configuration supplémentaire — utilisez simplement ce que vous avez déjà.

Nous élargissons activement notre réseau de partenaires. Si vous êtes un fournisseur de plateforme ou d'infrastructure intéressé par l'intégration de S2.1 Pro, contactez notre équipe pour explorer les possibilités.


Utilisation équitable et étapes suivantes

Le niveau gratuit fonctionne sous une Politique d'Utilisation Équitable. Nous nous réservons le droit de restreindre ou de limiter l'accès pour des schémas d'utilisation ressemblant à de l'abus plutôt qu'à du développement — l'objectif est de protéger l'accès pour toute la communauté des développeurs, et non de créer des limites arbitraires pour les cas d'utilisation légitimes. Voir Tarification et limites de débit pour plus de détails.

À quoi s'attendre :

  • L'accès gratuit est disponible dès maintenant pour une période initiale. Nous donnerons un préavis avant tout changement.
  • Des plans payants avec garanties de SLA, engagements de latence et licences commerciales sont disponibles pour les charges de travail en production.
  • L'investissement dans l'infrastructure est continu — le travail d'ingénierie qui a rendu ce niveau gratuit possible n'est pas un événement ponctuel.
  • Infrastructure open-source : Nous prévoyons de rendre open-source les composants d'infrastructure derrière S2.1 Pro — la même pile qui rend le niveau gratuit viable.

Si vous évaluez Fish Audio pour un déploiement en production, le niveau gratuit est le bon endroit pour commencer. Construisez quelque chose de réel, mesurez ce qui compte pour votre application et contactez-nous quand vous serez prêt à discuter des exigences de production.

Pas de carte de crédit. Pas de liste d'attente. Aucune limite à ce que vous pouvez essayer.

Obtenez votre clé API gratuite →

Questions Fréquemment Posées

Qu'est-ce qu'une API de synthèse vocale ?
Une API de synthèse vocale (TTS API) est un service Web qui convertit du texte écrit en audio parlé. Les développeurs envoient une chaîne de texte au point de terminaison de l'API et reçoivent en retour un fichier audio — généralement en MP3, WAV ou Opus — qui peut être lu dans des applications, stocké ou diffusé en temps réel. Les API vocales IA modernes comme S2.1 Pro utilisent des modèles de synthèse vocale neuronale pour produire un audio au son naturel qu'il est difficile de distinguer de la parole humaine.
Fish Audio S2.1 Pro est-il vraiment gratuit ?
Oui. S2.1 Pro est disponible sans frais via l'API Fish en utilisant l'identifiant de modèle `s2.1-pro-free`. Il n'y a pas de limite stricte de caractères — l'usage est soumis à une Politique d'Utilisation Équitable pour prévenir les abus. Le niveau gratuit ne comporte pas de SLA ni de garantie de latence, et les requêtes peuvent être conservées pour l'amélioration du modèle. Il est conçu pour le développement, le prototypage et l'évaluation. Consultez [Tarification et limites de débit](https://docs.fish.audio/developer-guide/models-pricing/pricing-and-rate-limits) pour tous les détails.
Quelle est la meilleure API TTS gratuite en 2026 ?
La meilleure API TTS gratuite dépend de votre cas d'utilisation. Parmi les principaux fournisseurs : Fish Audio S2.1 Pro offre un accès gratuit généreux à un modèle de génération actuelle, sans limite d'usage stricte et avec le support de 83 langues. ElevenLabs offre 10 000 crédits gratuits par mois avec accès à sa bibliothèque de voix. Les voix WaveNet héritées de Google sont gratuites jusqu'à 4 millions de caractères par mois. OpenAI TTS et le dernier Gemini TTS de Google n'ont pas de niveau gratuit. Pour les développeurs qui souhaitent évaluer une API vocale IA de pointe sans contraintes budgétaires, S2.1 Pro est un excellent point de départ.
Comment Fish Audio se compare-t-il à ElevenLabs ?
Fish Audio et ElevenLabs offrent tous deux une génération de voix neuronale et un clonage de voix de haute qualité. Les principales différences pratiques sur le niveau gratuit : le niveau gratuit de Fish Audio utilise le même modèle S2.1 Pro que le niveau payant sans limite d'usage stricte ; le niveau gratuit d'ElevenLabs est limité à 10 000 crédits par mois. En termes de couverture linguistique, Fish Audio prend en charge 83+ langues contre 70+ pour ElevenLabs. ElevenLabs dispose d'une plus grande bibliothèque de voix pré-enregistrées et d'un écosystème de création de contenu plus établi. Fish Audio a tendance à être plus performant pour les cas d'utilisation axés sur les développeurs nécessitant une faible latence, une haute concurrence ou un support multilingue. Consultez notre [comparaison TTS à l'aveugle](https://fish.audio/blog/blind-tts-provider-comparison-2026/) pour un benchmark indépendant.
Fish Audio prend-il en charge le clonage de voix ?
Oui. S2.1 Pro prend en charge le [clonage de voix à partir d'un audio de référence](https://docs.fish.audio/features/voice-cloning). Vous pouvez transmettre un échantillon audio de référence et le modèle synthétisera la parole avec cette voix. Cela fonctionne pour les 83 langues prises en charge, ce qui est particulièrement utile pour la localisation de contenu où une identité de locuteur cohérente est cruciale. Notre système de clonage de voix est l'un des plus performants de sa catégorie, offrant une grande cohérence du locuteur, une prosodie naturelle et une performance stable à travers les langues et les accents. Le clonage de voix est disponible dans le niveau gratuit, sous réserve de la même Politique d'Utilisation Équitable que tout autre usage de s2.1-pro-free.
Puis-je utiliser Fish Audio à des fins commerciales ?
Le niveau gratuit (`s2.1-pro-free`) peut comporter des restrictions sur certains scénarios commerciaux. Pour une utilisation commerciale en production avec licence complète, SLA et sans rétention de données, veuillez vous référer aux plans payants de Fish Audio. Consultez la [Tarification et limites de débit](https://docs.fish.audio/developer-guide/models-pricing/pricing-and-rate-limits) et les [Conditions d'utilisation](https://fish.audio/terms/) pour la politique actuelle.
Quelles langues Fish Audio prend-il en charge ?
S2.1 Pro prend en charge 83 langues, dont l'anglais, le japonais, le coréen, le chinois, l'espagnol, le portugais, l'arabe, le français, l'allemand, le russe, l'italien, le turc, le néerlandais, le polonais, le vietnamien, le thaï, l'indonésien et bien d'autres. Toutes les langues sont servies par le même modèle — il n'y a pas de points de terminaison séparés ni de paliers de tarification spécifiques par langue.
Shijia Liao

Shijia LiaoX

Founder & Chief-Scientist of Fish Audio.

Lire plus de Shijia Liao

Créez des voix qui semblent réelles

Commencez à générer un son de la plus haute qualité dès aujourd'hui.

Vous avez déjà un compte ? Se connecter