API de synthèse vocaleIntégrez la voix dans n'importe quelle application
Une voix expressive et dirigeable avec ~100ms de latence, le même modèle S2.1 Pro qui alimente HeyGen, Retell et Plaud.

Des modèles conçus pour différents besoins de production
Une seule API. Changez de modèle avec un simple en-tête. Les deux modèles API sont facturés au même tarif fixe.
S2 Pro
Précis même sur les énoncés les plus courts
- Clonage vocal instantané
- Support multilingue complet
- Fiable sur des prompts très courts
- Même tarif fixe que S2.1 Pro
S2.1 Pro
Le modèle le plus expressif proposé par Fish.
- Temps avant le premier audio ~100ms (sur un seul H200)
- Facteur temps réel de 0.195
- 80+ langues, changement de langue instantané
- Balises d'émotion en domaine ouvert
- Multi-locuteurs natif en une seule génération
On-premise
Déployez dans votre propre infrastructure.
- VPC, on-premise, cloud souverain, air-gapped
- Zéro sortie de données
- Contrôle total du modèle
- Licence commerciale disponible
Du compte à votre premier audio en 5 quelques minutes.
Aucun appel commercial requis. Obtenez une clé API, installez le SDK, et déployez.
curl https://api.fish.audio/v1/tts \-H "Authorization: Bearer YOUR_FISH_AUDIO_API_KEY" \-H "Content-Type: application/json" \-H "model: s2.1-pro" \-d '{"text": "[chuckle] When you are building something new, there is this [emphasis] mix of wonder and fear.","reference_id": "YOUR_VOICE_ID","format": "mp3"}' --output speech.mp3
from fishaudio import FishAudiofrom fishaudio.utils import saveclient = FishAudio(api_key="YOUR_FISH_AUDIO_API_KEY")audio = client.tts.convert(text="Hello from Fish Audio!",reference_id="YOUR_VOICE_ID",model="s2.1-pro",)save(audio, "output.mp3")
Tout ce dont vous avez besoinpour déployer de la voix en production
Une seule API pour la création de voix, la génération expressive et la diffusion en temps réel.
Émotion et interprétation intégrées
Direction écrite en syntaxe [tag], n'importe où dans le texte. Tags illimités et en texte libre, sans paramètre d'émotion séparé.
Des millions de voix de la communauté
Parcourez et déployez depuis la plus grande bibliothèque de voix ouverte, ou clonez la vôtre et construisez à partir de là.




Dialogue multi-locuteurs
Générez une conversation complète en une seule passe. Disponible sur S2.1 Pro.
Clonage vocal instantané
Capture le timbre et le style d'élocution à partir d'un court extrait de référence. Fonctionne dans les 80+ langues sans entraînement supplémentaire.
Lit le texte complexe naturellement
Nombres, devises, dates et unités prononcés correctement
Streaming et horodatage
Diffusez l'audio avec un horodatage au niveau du mot.
Créez l'expérience vocale dont votre produit a besoin
Créez une voix réutilisable, dirigez son interprétation, et diffusez-la dans des produits en temps réel.
Clonez n'importe quelle voix instantanément
avec Fish Audio
L'API de clonage vocal IA de Fish Audio transforme un court extrait de référence en une voix réutilisable. Le clone capture le timbre et le style d'élocution, et se transpose dans les 80+ langues sans entraînement supplémentaire.
# Clone from reference audiovoice = session.create_model(title="My Voice",voices=[open("reference.wav", "rb").read()])# Synthesize with the cloned voicerequest = TTSRequest(text="This is my cloned voice.",reference_id=voice.id)with open("clone.mp3", "wb") as f:for chunk in session.tts(request, backend="s2-pro"):f.write(chunk)
Fish Audio TTS APIBenchmarks et spécifications
Une seule API. Changez de modèle avec un simple en-tête. Les deux modèles API sont facturés au même tarif fixe.
POST https://api.fish.audio/v1/tts
FACTEUR TEMPS RÉEL
Court extrait
CLONAGE VOCAL
Natif
MULTI-LOCUTEURS
REST + WebSocket
STREAMING
Au niveau du mot
HORODATAGE
FRÉQUENCE D'ÉCHANTILLONNAGE
REQUÊTES CONCURRENTES
MP3 · WAV · Opus
FORMATS AUDIO
Une tarification flexible pour vos besoins
Limites de requêtes simultanées
Questions fréquentes
Passez en production ce week-end
Obtenez une clé API, installez le SDK, et déployez. Aucune carte bancaire requise.

