Text-to-Speech-APISprache in jede App integrieren
Ausdrucksstarke, steuerbare Sprache mit ~100ms Latenz – dasselbe S2.1 Pro-Modell hinter HeyGen, Retell und Plaud.

Modelle für unterschiedliche Produktionsanforderungen
Eine API. Modelle per einzelnem Header wechseln. Beide API-Modelle werden zum selben Pauschalpreis abgerechnet.
S2 Pro
Präzise selbst bei kürzesten Äußerungen
- Instant Voice Cloning
- Umfassende mehrsprachige Unterstützung
- Zuverlässig auch bei sehr kurzen Prompts
- Derselbe Pauschalpreis wie S2.1 Pro
S2.1 Pro
Das ausdrucksstärkste Modell von Fish.
- Zeit bis zum ersten Audio ~100ms (auf einem einzelnen H200)
- Echtzeitfaktor 0.195
- 80+ Sprachen, sofortiges Code-Switching
- Open-Domain-Emotions-Tags
- Native Mehrsprecher-Funktion in einer Generierung
On-Premise
Bereitstellung in deiner eigenen Infrastruktur.
- VPC, On-Prem, Sovereign Cloud, Air-Gapped-Umgebung
- Kein Datenabfluss
- Volle Kontrolle über das Modell
- Kommerzielle Lizenz verfügbar
Von der Registrierung zum ersten Audio in 5 Minuten.
Kein Sales-Call erforderlich. API-Key holen, SDK installieren und loslegen.
curl https://api.fish.audio/v1/tts \-H "Authorization: Bearer YOUR_FISH_AUDIO_API_KEY" \-H "Content-Type: application/json" \-H "model: s2.1-pro" \-d '{"text": "[chuckle] When you are building something new, there is this [emphasis] mix of wonder and fear.","reference_id": "YOUR_VOICE_ID","format": "mp3"}' --output speech.mp3
from fishaudio import FishAudiofrom fishaudio.utils import saveclient = FishAudio(api_key="YOUR_FISH_AUDIO_API_KEY")audio = client.tts.convert(text="Hello from Fish Audio!",reference_id="YOUR_VOICE_ID",model="s2.1-pro",)save(audio, "output.mp3")
Alles, was du brauchst,um produktionsreife Sprache auszuliefern
Eine API für Stimmerstellung, ausdrucksstarke Generierung und Echtzeit-Auslieferung.
Inline-Emotion und Vortragsstil
Stimmsteuerung als [tag]-Syntax, an beliebiger Stelle im Text. Unbegrenzt viele frei wählbare Tags, kein separater Emotionsparameter.
Millionen von Community-Stimmen
Durchstöbere die größte offene Stimmbibliothek und nutze sie direkt – oder klone deine eigene Stimme und baue darauf auf.




Mehrsprecher-Dialog
Erzeuge ein komplettes Gespräch in einem Durchgang. Verfügbar für S2.1 Pro.
Instant Voice Cloning
Erfasst Klangfarbe und Sprechstil aus einem kurzen Referenzclip. Funktioniert in allen 80+ Sprachen – ganz ohne zusätzliches Training.
Komplexe Texte natürlich vorlesen
Zahlen, Währungen, Daten und Einheiten korrekt ausgesprochen
Streaming und Zeitstempel
Audio streamen mit wortgenauen Zeitstempeln.
Baue das Sprach-Erlebnis, das dein Produkt braucht
Erstelle eine wiederverwendbare Stimme, steuere ihre Performance und streame sie in Echtzeitprodukte.
Klone jede Stimme sofort
mit Fish Audio
Die KI-Voice-Cloning-API von Fish Audio verwandelt einen kurzen Referenzclip in eine wiederverwendbare Stimme. Der Klon erfasst Klangfarbe und Sprechstil und funktioniert in allen 80+ Sprachen – ganz ohne zusätzliches Training.
# Clone from reference audiovoice = session.create_model(title="My Voice",voices=[open("reference.wav", "rb").read()])# Synthesize with the cloned voicerequest = TTSRequest(text="This is my cloned voice.",reference_id=voice.id)with open("clone.mp3", "wb") as f:for chunk in session.tts(request, backend="s2-pro"):f.write(chunk)
Fish Audio TTS APIBenchmarks und Specs
Eine API. Modelle per einzelnem Header wechseln. Beide API-Modelle werden zum selben Pauschalpreis abgerechnet.
POST https://api.fish.audio/v1/tts
ECHTZEITFAKTOR
Kurzer Clip
VOICE CLONING
Nativ
MEHRSPRECHER
REST + WebSocket
STREAMING
Wortgenau
ZEITSTEMPEL
SAMPLERATE
GLEICHZEITIGE ANFRAGEN
MP3 · WAV · Opus
AUDIOFORMATE
Flexible Preise für deinen Bedarf
Limits für gleichzeitige Anfragen
Häufig gestellte Fragen
Dieses Wochenende in Produktion gehen
API-Key holen, SDK installieren und loslegen. Keine Kreditkarte erforderlich.

