IA vocale de niveau production.Tarifée comme une startup.Ouverte comme une communauté.
Intégrez synthèse vocale réaliste, clonage de voix et transcription avec une seule API. SDK Python et TypeScript officiels. Latence sous la seconde. Paiement à l'utilisation dès le premier appel.

S2.1 Pro en live. Choisissez une voix, saisissez une ligne, puis écoutez le résultat. Le même modèle derrière HeyGen, Retell et Sanas en production — sans inscription, sans appel commercial, sans environnement de démo.
# The same call. The (direction) tags travel with the text.
curl https://api.fish.audio/v1/tts \
-H "Authorization: Bearer $FISH_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"text": "[chuckle] When you’re creating something new, there’s this [emphasis] beautiful mix of wonder and fear.",
"reference_id": "933563129e564b19a115bedd57b7406a",
"format": "mp3"
}' --output speech.mp3Du compte à votre premier audio en 5 quelques minutes.
Aucun appel commercial requis. Obtenez une clé API, installez le SDK, et déployez.
# Text to speech in one callcurl -X POST \ https://api.fish.audio/v1/tts \-H "Authorization: Bearer $FISH_API_KEY" \-H "Content-Type: application/json" \-H "model: s2.1-pro-free" \-d '{"text": "Hello! Welcome to Fish Audio."}' \--output welcome.mp3
# Text to speech with the Python SDKfrom fish_audio_sdk import Session, TTSRequestsession = Session("YOUR_API_KEY")request = TTSRequest(text="Hello! Welcome to Fish Audio.")with open("welcome.mp3", "wb") as f:for chunk in session.tts(request):f.write(chunk)
Ce que les équipes déploient sur Fish.
Une voix qui tient à l'écran
# Vidéo d'avatarTTS lip-syncable et sensible aux émotions pour les produits d'avatars IA. Les tags de direction inline pilotent la performance, pas seulement les mots.
IA conversationnelle temps réel
# Agent vocalPrise de parole en moins d'une seconde via WebSocket. Streaming TTS et ASR dans une seule stack. Gestion des interruptions.
Contenu parlé dynamique.
# Contenu audio & compagnonsNotes vers audio, outils de préparation, compagnons IA. Tarification au caractère qui évolue avec l'usage, pas avec les sièges.
Clonez en 30 secondes. Ou ignorez le clonage.
# Apps de personnagesIVC à partir de 30 secondes d’audio. PVC pour des répliques de qualité studio. Ou parcourez la bibliothèque de voix et déployez sans clonage.
Conçu pour la stack temps réel.
Open weights. Licence commerciale payante.
Nos modèles open source — fish-speech, S1 et S2 — sont disponibles en open weights avec une licence commerciale payante. Hébergez-les dans votre VPC, on-premise, cloud souverain ou environnement air-gapped lorsque la production l'exige. L'auto-hébergement est un engagement de niveau Enterprise — voir ci-dessous.
15,000+ tags de direction. Intégrés à chaque appel.
[warm], [near-whisper], [reassuring] — la direction accompagne le texte lui-même. Aucun paramètre séparé, aucune liste à sélectionner, aucune migration de schéma quand le jeu de tags s’agrandit.
Test de Turing Audio : 0.515.
Les auditeurs ne distinguent pas de manière fiable S2.1 Pro d'une voix humaine en évaluation à l'aveugle. 581 comparaisons directes. Méthodologie et audios bruts publiés.
$15 par million de caractères. Dès votre premier appel.
Le même modèle derrière HeyGen, Pictoria, Dubbing AI et Plaud. Paiement à l'utilisation dès votre premier appel. Pas de "contactez-nous" pour les tarifs de production.
Utilisez notre API. Ou hébergez le modèle vous-même
API cloud pour toute équipe qui développe aujourd'hui. Auto-hébergement en tant qu'engagement Enterprise premium lorsque la production l'exige.
API hébergée · Toute équipe
API cloud, paiement à l'utilisation, $15 par million de caractères. La voie la plus rapide vers la production pour les équipes qui n'ont pas besoin d'opérer le modèle elles-mêmes.
- Streaming WebSocket, REST, SDK Python + TypeScript
- $15 / 1M UTF-8 bytes — sans engagement
- Syntaxe de direction intégrée dans chaque appel
- Le même modèle que celui publié en open weights
Hébergez le modèle vous-même.
Nos modèles open source — fish-speech, S1, S2 — sont disponibles en open weights avec une licence commerciale payante. Déployez-les dans votre VPC, votre centre de données, un cloud souverain ou un environnement air-gapped. Un engagement premium pour les équipes à fort volume ayant des besoins de résidence des données, de fine-tuning ou de déploiement réglementé.
- Streaming WebSocket, REST, SDK Python + TypeScript
- $10k/mois
- Plancher effectif : $120–150K/an
- Accès direct à notre équipe de recherche
Une tarification quine pénalise pas la croissance
Paiement à l'utilisation dès le premier jour. Pas de frais par siège. Pas d'engagements annuels. Pas de "contactez-nous" pour les tarifs de production.
Voir la tarification complèteQuestions fréquentes
Vous migrez depuis ElevenLabs, Cartesia ou Rime ?
Comparaisons détaillées par fonctionnalité, prix et conditions contractuelles. API de même forme ; la plupart des migrations en production se terminent en moins d'une semaine.
Les benchmarks, la méthodologie et les audios bruts
Résultats du test de Turing Audio, méthodologie d'évaluation à l'aveugle et licence open weights. Les preuves derrière chaque affirmation de cette page.
Passez en production ce week-end
Crédits gratuits pour démarrer. Sans carte bancaire. Même niveau tarifaire du prototype à l'échelle.
