Un an.

52M$ de seed.

8M+ créateurs.

Notre histoire

API de synthèse vocaleIntégrez la voix dans n'importe quelle application

Une voix expressive et dirigeable avec ~100ms de latence, le même modèle S2.1 Pro qui alimente HeyGen, Retell et Plaud.

curl https://api.fish.audio/v1/tts \
  -H "Authorization: Bearer YOUR_FISH_AUDIO_API_KEY" \
  -H "Content-Type: application/json" \
  -H "model: s2.1-pro" \
  -d '{
    "text": "[chuckle] Quand on construit quelque chose de nouveau, il y a ce [audience laughing] mélange d'émerveillement et de peur. [whisper] Mais c'est justement ce qui en vaut la peine.",
    "reference_id": "933563129e564b19a115bedd57b7406a",
    "format": "mp3"
  }' --output speech.mp3
<100ms
TEMPS AVANT LE PREMIER AUDIO
Illimité
tags de direction
80+
LANGUES
$15/1M UTF-8 bytes
PAIEMENT À L'UTILISATION

En production chez

Des modèles conçus pour différents besoins de production

Une seule API. Changez de modèle avec un simple en-tête. Les deux modèles API sont facturés au même tarif fixe.

L'ORIGINAL

S2 Pro

Précis même sur les énoncés les plus courts

  • Clonage vocal instantané
  • Support multilingue complet
  • Fiable sur des prompts très courts
  • Même tarif fixe que S2.1 Pro
Voir la doc
RECOMMANDÉ

S2.1 Pro

Le modèle le plus expressif proposé par Fish.

  • Temps avant le premier audio ~100ms (sur un seul H200)
  • Facteur temps réel de 0.195
  • 80+ langues, changement de langue instantané
  • Balises d'émotion en domaine ouvert
  • Multi-locuteurs natif en une seule génération
Voir la doc
DÉPLOIEMENT ENTERPRISE

On-premise

Déployez dans votre propre infrastructure.

  • VPC, on-premise, cloud souverain, air-gapped
  • Zéro sortie de données
  • Contrôle total du modèle
  • Licence commerciale disponible
Contacter les ventes

Du compte à votre premier audio en 5 quelques minutes.

Aucun appel commercial requis. Obtenez une clé API, installez le SDK, et déployez.

cURL · REST API
curl https://api.fish.audio/v1/tts \
-H "Authorization: Bearer YOUR_FISH_AUDIO_API_KEY" \
-H "Content-Type: application/json" \
-H "model: s2.1-pro" \
-d '{
"text": "[chuckle] When you are building something new, there is this [emphasis] mix of wonder and fear.",
"reference_id": "YOUR_VOICE_ID",
"format": "mp3"
}' --output speech.mp3
Python · Fish Audio SDK
from fishaudio import FishAudio
from fishaudio.utils import save
client = FishAudio(api_key="YOUR_FISH_AUDIO_API_KEY")
audio = client.tts.convert(
text="Hello from Fish Audio!",
reference_id="YOUR_VOICE_ID",
model="s2.1-pro",
)
save(audio, "output.mp3")

Tout ce dont vous avez besoinpour déployer de la voix en production

Une seule API pour la création de voix, la génération expressive et la diffusion en temps réel.

Émotion et interprétation intégrées

Direction écrite en syntaxe [tag], n'importe où dans le texte. Tags illimités et en texte libre, sans paramètre d'émotion séparé.

Aber
Hey there.Add TagsI’m so excited to share this news!Can you hear me?
[Sad]
[Excited]
[satisfied]
[angry]

Des millions de voix de la communauté

Parcourez et déployez depuis la plus grande bibliothèque de voix ouverte, ou clonez la vôtre et construisez à partir de là.

Dialogue multi-locuteurs

Générez une conversation complète en une seule passe. Disponible sur S2.1 Pro.

Aber
Sarah
Ethan

Clonage vocal instantané

Capture le timbre et le style d'élocution à partir d'un court extrait de référence. Fonctionne dans les 80+ langues sans entraînement supplémentaire.

Recorded Voice
My Cloned Voice
EnglishFemaleYoung

Lit le texte complexe naturellement

Nombres, devises, dates et unités prononcés correctement

$9.99
01/24
1,999

Streaming et horodatage

Diffusez l'audio avec un horodatage au niveau du mot.

Thefutureiscoming
0.02s0.05s0.01s0.04svoice0.01s0.03s

Créez l'expérience vocale dont votre produit a besoin

Créez une voix réutilisable, dirigez son interprétation, et diffusez-la dans des produits en temps réel.

Clonez n'importe quelle voix instantanément
avec Fish Audio

L'API de clonage vocal IA de Fish Audio transforme un court extrait de référence en une voix réutilisable. Le clone capture le timbre et le style d'élocution, et se transpose dans les 80+ langues sans entraînement supplémentaire.

PYTHON SDK
# Clone from reference audio
voice = session.create_model(
title="My Voice",
voices=[open("reference.wav", "rb").read()]
)
# Synthesize with the cloned voice
request = TTSRequest(
text="This is my cloned voice.",
reference_id=voice.id
)
with open("clone.mp3", "wb") as f:
for chunk in session.tts(request, backend="s2-pro"):
f.write(chunk)

Fish Audio TTS APIBenchmarks et spécifications

Une seule API. Changez de modèle avec un simple en-tête. Les deux modèles API sont facturés au même tarif fixe.

POST https://api.fish.audio/v1/tts

Benchmarks
0.195

FACTEUR TEMPS RÉEL

Court extrait

CLONAGE VOCAL

Natif

MULTI-LOCUTEURS

REST + WebSocket

STREAMING

Au niveau du mot

HORODATAGE

48kHz

FRÉQUENCE D'ÉCHANTILLONNAGE

5de départ

REQUÊTES CONCURRENTES

MP3 · WAV · Opus

FORMATS AUDIO

Une tarification flexible pour vos besoins

Paiement à l'utilisation, quel que soit l'abonnementEn savoir plus

S2.1 Pro

Synthèse vocale

$0.015/ K UTF-8 bytes
Commencer
Latence ultra-faible de 70 ms
80+ langues prises en charge
Horodatage au niveau du mot

S2 Pro

Synthèse vocale

$0.015/ K UTF-8 bytes
Commencer
Latence temps réel
Support multilingue complet
Clonage vocal instantané

Transcribe-1

Reconnaissance vocale automatique

$0.006/ minute audio
Commencer
Précision ASR leader du secteur
Multilingue avec indices de langue optionnels
Transcription d'entrées longues

Limites de requêtes simultanées

 
Seuil de dépenseConcurrence
Starter
< $100 payés5 requêtes
Avancé
≥ $100 payés15 requêtes
Volume élevé
≥ $1,000 payés50 requêtes
Enterprise
Sur mesureLimites sur mesure

Questions fréquentes

Fish Audio

Passez en production ce week-end

Obtenez une clé API, installez le SDK, et déployez. Aucune carte bancaire requise.